Interviuri

Dani Cherkassky, CEO și Co-Fondator al Kardome – Seria de Interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Dani Cherkassky, CEO și Co-Fondator al Kardome, aduce peste două decenii de experiență în acustică, procesare de semnal și dezvoltare de algoritmi în fruntea inovației tehnologiei vocale. Înainte de a fonda Kardome, a ocupat funcția de CTO la Silentium Ltd., unde a condus colaborări de cercetare și dezvoltare cu companii de top și instituții de cercetare. Cu un doctorat în Procesarea de Matrice de Microfoane de la Universitatea Bar-Ilan, Cherkassky combină o expertiză tehnică profundă cu o misiune clară — de a elimina frustrările interacțiunii vocale moderne prin crearea unei tehnologii care ascultă cu adevărat oamenii, nu zgomotul din jurul lor.

Kardome este pionier în soluții de auz spațial bazate pe inteligență artificială, care oferă interacțiuni vocale personalizate și clare în orice mediu — de la mașini și săli de conferințe la case inteligente și spații publice. Tehnologia sa de clusterizare a vorbirii separă vocile pe baza locației, permițând dispozitivelor să înțeleagă fiecare vorbitor ca și cum ar fi singura persoană care vorbește. Proiectată pentru a fi agnostică din punct de vedere al hardware-ului și gata pentru margine, platforma Kardome îmbunătățește acuratețea recunoașterii vorbirii, securitatea și experiența utilizatorului, alimentând următoarea generație de comunicare om-mașină.

Ce v-a inspirat pe dumneavoastră și pe Dr. Alon Slapak să fondați Kardome?

Inspiratia pentru Kardome a crescut dintr-o combinație de fascinație și frustrare. Cu fundalul nostru în vorbire și audio, atât în academia, cât și în industrie, am fost încântați de progresul în recunoașterea vorbirii, în special atunci când rețelele neuronale profunde au intrat în scenă.

Într-un laborator liniștit, tehnologia a fost fenomenală. Dar în momentul în care ați pășit în lumea reală, acea magie a dispărut. Am observat că, într-o mașină zgomotoasă, un birou aglomerat sau o casă haotică, sistemele avansate de ultimă generație erau abia mai bune decât tehnologia anilor ’90. Acesta a fost marele obstacol în calea progresului.

Vorbitul este cel mai natural mod de a interacționa cu dispozitivele noastre, adevăratul succesor al ecranului tactil. Dar, pentru ca acest lucru să se întâmple, tehnologia trebuia să învingă haosul vieții reale. Am decis să facem aceasta misiune. Am petrecut un an în garaj, luptându-ne cu ecuațiile de propagare a undelor sonore și testând noi idei, până am realizat o descoperire: prima demonstrație a ceea ce este acum cunoscut sub numele de Tehnologia de Auz Spațial Kardome.

În acel moment, am știut că avem cheia. Am fondat Kardome nu doar pentru a construi un produs, ci pentru a începe o revoluție în modul în care oamenii și mașinile comunică.

De ce sistemele convenționale de asistenți vocali se confruntă cu dificultăți și adesea frustră utilizatorii atunci când vocile se suprapun sau zgomotul de fond preia controlul?

Sistemele convenționale de interfață vocală se descurcă prost în lumea reală pentru că software-ul lor se bazează pe o metodă prea simplă pentru a înțelege sunetul. Majoritatea sistemelor folosesc mai multe microfoane pentru a determina direcția de sosire a unui sunet, o abordare care se concentrează doar asupra unghiului unui sunet, ignorând alte informații spațiale tridimensionale cruciale. Această metodă eșuează imediat în orice mediu real — cum ar fi o mașină, un birou sau o cameră de zi — deoarece aceste medii sunt pline de reverberație, unde undele sonore se reflectă de la fiecare suprafață reflectorizantă. Pentru un sistem care înțelege doar direcția, fiecare dintre aceste reflexii este percepută ca un sunet nou de la o direcție diferită.

Acest lucru creează un efect dezorientant, ca și cum dispozitivul ar fi într-o sală de “oglinzi acustice”, unde o singură voce pare să vină de la sute de direcții simultan. Incapabil să distingă vocile distincte ale vorbitorilor de furtuna de reflexii, sistemul nu poate decoda corect peisajul sonor. Această limitare fundamentală este exact motivul pentru care tehnologiile vocale actuale au o percepție atât de slabă a audio în scenariile haotice ale lumii reale și, în cele din urmă, nu funcționează în mod fiabil.

Tehnologiile Kardome tratează fiecare persoană ca și cum ar fi singura care vorbește în cameră. Care este descoperirea tehnică care face acest lucru posibil și cum se diferențiază de recunoașterea vocală convențională la distanță?

Descoperirea noastră tehnică este o tehnologie proprie numită Auz Spațial AI, care depășește metodele convenționale care detectează doar direcția unui sunet pentru a determina poziția exactă în spațiu tridimensional. Funcționează prin analizarea întregului model de reflexie pe care o voce îl creează într-o cameră, tratând modul complex în care sunetul se reflectă de la suprafețe ca o “amprentă acustică” unică pentru acea poziție. Inteligența noastră artificială inferă instantaneu și pasiv această amprentă pentru fiecare sursă de sunet, efectiv cartografiind mediul. Abordarea bazată pe locație este fundamental diferită de sistemele convenționale conduse de direcție, care se confundă ușor de reflexiile pe care le folosim ca date valoroase. În timp ce ele aud o singură voce ca o mulțime de ecouri, tehnologia noastră utilizează modelul complet de reflexie pentru a determina sursa reală. Rezultatul practic este că un dispozitiv compatibil cu Kardome poate se concentra asupra unei singure persoane într-un mediu zgomotos și o aude ca și cum ar vorbi singură într-o cameră liniștită. În plus, Inteligența Cognitivă asigură că sistemul nu numai aude cuvintele, dar și înțelege cine le-a spus și ce înseamnă în context.

Se spune că Inteligența Vocală AI are “momentul iPhone”. Din perspectiva dumneavoastră, ce înseamnă acest lucru și cât de aproape suntem de adoptarea cu adevărat mainstream a acesteia?

Pentru mine, “momentul iPhone” înseamnă că vocea este, în sfârșit, gata să devină modul implicit de interacțiune cu dispozitivele noastre computaționale.

Văd producătorii de dispozitive care se grăbesc să integreze tehnologii de inteligență vocală în întreaga gamă de produse. Mașinile devin interfețe vocale primare din motive de siguranță. Casele inteligente au nevoie de interfețe vocale deoarece nu este fezabil să pună ecrane tactile peste tot. Electronica tradițională adaugă, de asemenea, capacități vocale pentru că este adesea mai rapidă decât navigarea în meniuri. În timp ce multe tehnologii conduc adoptarea vocii, revoluția adevărată va fi dictată de roboți. Pe măsură ce roboții se integrează în casele și locurile noastre de muncă, vocea va apărea ca singura interfață naturală și eficientă pentru interacțiune.

Pentru ca această coexistență să fie fără cusur, roboții trebuie să ne înțeleagă la nivel uman. Ei trebuie să înțeleagă contextul și nuanța vorbirii naturale, nu doar cuvintele cheie. Ei necesită o conștientizare spațială atât de precisă încât pare magică — știind instinctiv că dumneavoastră sunteți cel care vorbește lor, chiar și într-o cameră zgomotoasă. În mod critic, această inteligență trebuie să funcționeze pe margine pentru o comunicare instantanee, privată și fiabilă.

Acesta nu este un progres incremental; este o schimbare fundamentală în modul în care oamenii și mașinile vor interacționa. Suntem pe cale să construim tehnologia care va conduce această redefinire. Aș spune că suntem la aproximativ 24 de luni distanță de punctul de inflexiune în care vocea va deveni interfața așteptată, mai degrabă decât o caracteristică plăcută.

În termeni practici, cum vedeți auzul spațial și inteligența cognitivă transformând dispozitivele de uz casnic — de la mașini și case inteligente la dispozitive purtabile și spații publice?

Transformarea constă în permisivitatea interacțiunii naturale, oriunde sunteți, fără a adapta comportamentul pentru a se potrivi tehnologiei. În mașini, acest lucru înseamnă controlul cu adevărat fără mâini care funcționează în timp ce conduceți la viteze de autostradă, cu muzică și pasageri care vorbesc. Casele inteligente devin cu adevărat inteligente atunci când pot înțelege cine vorbește și de unde, gestionând cereri simultane fără confuzie.

Cheia insight-ului este că auzul spațial AI nu doar îmbunătățește recunoașterea vocii, ci permite paradigme de interacțiune complet noi. Atunci când dispozitivele pot înțelege întregul peisaj acustic, ele pot participa la fluxul natural al comunicării umane, în loc de a se baza pe constrângeri artificiale. Dispozitivele purtabile devin mult mai utile atunci când pot izola vocea dvs. de la conversațiile din jur, iar spațiile publice pot oferi asistență vocală personalizată, dar privată. Așa cum am menționat și pentru roboți, aceasta constituie o schimbare fundamentală în modul în care oamenii și mașinile vor interacționa cu roboții care devin integrați în viețile noastre.

Confidențialitatea este o preocupare în creștere cu dispozitivele care ascultă mereu. Cum echilibrează Kardome cererea de procesare pe dispozitiv cu nevoia de performanță și acuratețe?

Majoritatea soluțiilor actuale de Inteligență Vocală AI funcționează pe un model hibrid, alcătuit dintr-o componentă de margine (pe dispozitiv) și una bazată pe cloud. În timp ce procesarea pe margine nu ridică probleme de confidențialitate, deoarece datele nu părăsesc niciodată dispozitivul utilizatorului, procesarea în cloud prezintă o provocare semnificativă pentru confidențialitatea datelor.

Kardome abordează această provocare prin extinderea considerabilă a capacităților componentei de margine. Prin procesarea mai multor date local și reducerea dependenței de cloud, Kardome asigură că datele vocale sensibile nu părăsesc niciodată dispozitivul, oferind o protecție superioară a confidențialității în comparație cu alte sisteme de pe piață.

O preocupare majoră cu dispozitivele “care ascultă mereu” nu este reprezentată de faptul că microfonul captează audio, ci de riscul ca acest audio să fie încărcat în cloud pentru analiză. În practică, costul prohibitiv al procesării continue în cloud înseamnă că majoritatea sistemelor comerciale evită acest lucru, dar acest lucru se face cu prețul unei calități mai scăzute și a unei interfețe vocale mai puțin receptive.

Kardome rezolvă acest compromis prin aducerea de modele lingvistice puternice și mereu active pe dispozitivul de margine însuși. Cu tehnologia noastră, scena acustică, vorbirea naturală și contextul sunt toate analizate în timp real direct pe dispozitiv. Niciun dată vocal nu este niciodată încărcat sau salvat. Această abordare inovatoare permite Kardome să ofere atât confidențialitate robustă a datelor, cât și o interfață vocală eficientă, eliminând compromisul cu care se confruntă utilizatorii în prezent.

Privind industria în ansamblu, care sunt cele mai mari obstacole pe care inteligența vocală AI trebuie să le depășească înainte de a deveni interfața dominantă în electronica de consum?

Obstacolul cel mai mare este că inteligența vocală AI nu comunică încă ca oamenii. Până când inteligența vocală AI nu va putea auzi și înțelege ca oamenii, cu o conștientizare deplină a contextului și capacitatea de a înțelege fluxul conversației, nu va deveni interfața principală pe care oamenii o doresc. Un obstacol tehnic semnificativ în acest moment este că majoritatea tehnologiei de Inteligență Vocală AI este bazată pe cloud. Acest lucru împiedică în mod inerent ascultarea continuă și, prin urmare, împiedică înțelegerea fluxului conversației.

Prin urmare, va veni o descoperire atunci când sistemele vocale vor putea înțelege cu adevărat contextul conversației și vor răspunde cu aceeași conștientizare intuitivă pe care o au oamenii. Atunci va deveni inteligența vocală interfața dominantă în toată electronica de consum.

Cum credeți că relația consumatorilor cu asistenții vocali va evolua odată ce acuratețea și fiabilitatea în medii zgomotoase vor fi rezolvate?

Odată ce fiabilitatea și conversația naturală sunt rezolvate, asistenții vocali vor trece de la a fi caracteristici noi la a deveni interfețe esențiale de care oamenii depind pe tot parcursul zilei. Când oamenii știu că inteligența vocală AI va înțelege corect prima dată, chiar și în medii provocatoare, ei vor înceta să se adapteze tehnologiei și vor începe să o folosească instinctiv, cu limbaj natural și conversații contextuale.

Viitorul interacțiunii vocale va fi predictiv și proactiv. Imaginați-vă dispozitivul dvs. înțelegând nu doar cuvintele, ci și tonul, semnele emoționale și subtextul conversațional. Sistemele actuale se luptă cu ritmul natural al conversației și nu pot face față întreruperilor, schimbului de roluri și înțelegerii contextuale. Oamenii se adaptează atunci când sunt întrerupți; inteligența vocală AI se confundă adesea. Pentru producătorii de echipamente originale, provocarea constă în integrarea inteligenței vocale AI care poate livra această interfață viitoare fără complexitatea și cerințele de hardware ale soluțiilor actuale.

În cele din urmă, unde vedeți Kardome și ecosistemul de inteligență vocală AI peste cinci ani și care vor fi reperele care vor defini dacă am intrat cu adevărat în era calculului vocal?

Peste cinci ani, inteligența vocală AI va fi la fel de ubicuă ca ecranele tactile și tastaturile sunt astăzi, și va fi așteptată în practic toate dispozitivele computaționale. Kardome va fi sistemul de operare care va permite utilizatorilor să-și controleze dispozitivele prin voce, permițând interacțiuni naturale cu orice dispozitiv, în orice mediu, de la roboți la ochelari inteligenți, mașini.

Reperelor definitorii vor fi comportamentale, mai degrabă decât tehnice. Vom ști că am atins calculul vocal atunci când oamenii vor înceta să se gândească la comenzi vocale și vor începe să aibă conversații naturale cu mediul lor, atunci când mediile cu mai mulți utilizatori vor funcționa fără cusur, și atunci când copiii vor crește așteptându-se să vorbească cu orice dispozitiv în mod natural. Măsura finală nu va fi cât de sofisticată devine tehnologia noastră, ci cât de natural oamenii interacționează cu lumea digitală.

Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe despre Kardome ar trebui să viziteze Kardome.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.