Wywiady

Dani Cherkassky, CEO i współzałożyciel Kardome – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Dani Cherkassky, CEO i współzałożyciel Kardome, posiada ponad dwie dekady doświadczenia w dziedzinie akustyki, przetwarzania sygnałów i rozwoju algorytmów, które znajdują zastosowanie w innowacjach technologicznych związanych z głosem. Przed założeniem Kardome pełnił funkcję CTO w firmie Silentium Ltd., gdzie kierował współpracą badawczo-rozwojową z firmami z pierwszej ligi i instytucjami badawczymi. Posiadając tytuł doktora w dziedzinie przetwarzania tablicy mikrofonów na Uniwersytecie Bar-Ilan, Cherkassky łączy głęboką wiedzę techniczną z wyraźną misją — wyeliminowaniem frustracji związanych z interakcją głosową poprzez tworzenie technologii, która naprawdę słucha ludzi, a nie hałasu wokół nich.

Kardome jest pionierem w dziedzinie rozwiązań opartych na sztucznej inteligencji, które dostarczają klarowne, personalizowane interakcje głosowe w każdym środowisku — od samochodów i sal konferencyjnych po inteligentne domy i przestrzenie publiczne. Ich własna technologia grupowania mowy rozdziela głosy na podstawie położenia, pozwalając urządzeniom zrozumieć każdego mówcę, jakby był on jedyną osobą, która mówi. Zaprojektowane w sposób niezależny od sprzętu i gotowe do pracy na krawędzi, platforma Kardome zwiększa dokładność rozpoznawania mowy, bezpieczeństwo i komfort użytkowania, napędzając następną generację komunikacji między ludźmi a maszynami.

Czym skłoniło Was, Ciebie i dr. Alona Slapaka, do współzałożenia Kardome?

Pomysł na Kardome powstał z połączenia fascynacji i frustracji. Z naszym doświadczeniem w dziedzinie mowy i audio, zarówno w środowisku akademickim, jak i przemysłowym, byliśmy zachwyceni postępem w rozpoznawaniu mowy, szczególnie gdy sieci neuronowe głębokie wkroczyły na scenę.

W cichym laboratorium technologia była fenomenalna. Ale gdy tylko wyszliśmy do świata rzeczywistego, ta magia zniknęła. Zaobserwowaliśmy, że w hałaśliwym samochodzie, zajętym biurze lub chaotycznym domu, najnowocześniejsze, zaawansowane systemy były ledwo lepsze niż technologia z lat 90. To było wielką barierą dla postępu.

Głos jest najbardziej naturalnym sposobem interakcji z naszymi urządzeniami, prawdziwym następcą ekranu dotykowego. Ale aby to mogło się stać, technologia musi pokonać chaotyczny świat rzeczywisty. Postanowiliśmy uczynić to naszym celem. Spędziliśmy rok w garażu, walcząc z równaniami propagacji fal dźwiękowych i testując nowe pomysły, aż do osiągnięcia przełomu: pierwszej demonstracji tego, co jest obecnie znane jako technologia słuchu przestrzennego Kardome.

W tym momencie wiedzieliśmy, że mamy klucz. Założyliśmy Kardome nie tylko po to, aby zbudować produkt, ale aby rozpocząć rewolucję w sposobie, w jaki ludzie i maszyny komunikują się.

Wiele asystentów głosowych ma trudności i często frustruje użytkowników, gdy głosy nachodzą na siebie lub hałas tła dominuje. Dlaczego konwencjonalne metody działają tak słabo w tych realnych warunkach?

Konwencjonalne interfejsy głosowe działają słabo w świecie rzeczywistym, ponieważ ich oprogramowanie opiera się na zbyt uproszczonym sposobie zrozumienia dźwięku. Większość systemów wykorzystuje wiele mikrofonów, aby określić kierunek nadejścia dźwięku, podejście, które koncentruje się tylko na kącie dźwięku, ignorując inne istotne informacje przestrzenne. Metoda ta niepowoduje w każdym realnym środowisku — jak samochód, biuro lub pokój — ponieważ te środowiska są wypełnione reverberacją, gdzie fale dźwiękowe odbijają się od każdej powierzchni odbijającej. Dla systemu, który rozumie tylko kierunek, każde z tych odbitych refleksji jest postrzegane jako nowy dźwięk z innego położenia.

Tworzy to dezorientujący efekt, jakby urządzenie było w „akustycznym lustrze”, gdzie jeden głos wydaje się pochodzić z setek kierunków jednocześnie. Niezdolny do odróżnienia odrębnych głosów mówców od burzy refleksji, system nie może właściwie odszyfrować pejzażu dźwiękowego. To fundamentalne ograniczenie jest dokładnie powodem, dla którego obecne technologie głosowe mają tak słabą percepcję dźwięku w realnych, chaotycznych scenariuszach i ostatecznie nie działają niezawodnie.

Technologie Kardome traktują każdego człowieka tak, jakby był on jedyną osobą mówiącą w pokoju. Jaki przełom techniczny umożliwia to, i jak różni się to od konwencjonalnego rozpoznawania głosu na odległość?

Naszym przełomem technicznym jest własna technologia zwana Spatial Hearing AI, która przewyższa konwencjonalne metody, które tylko wykrywają kierunek dźwięku, aby zamiast tego określić jego dokładne położenie w trójwymiarowej przestrzeni. Działa ona przez analizę całego wzorca refleksji, jaki dźwięk tworzy w pomieszczeniu, traktując złożony sposób, w jaki dźwięk odbija się od powierzchni, jako unikalną „optyczną odcisk palca” dla tego konkretnego położenia. Nasza sztuczna inteligencja błyskawicznie i biernie wnioskuje ten odcisk palca dla każdego źródła dźwięku, efektywnie mapując środowisko. To podejście oparte na położeniu jest fundamentalnie różne od konwencjonalnych systemów napędzanych kierunkiem, które łatwo się mylą tymi samymi refleksjami, które my używamy jako cennych danych. Podczas gdy one słyszą jednego mówcę jako tłum echa, nasza technologia wykorzystuje cały wzorzec refleksji, aby wskazać rzeczywiste źródło. Praktycznym rezultatem jest to, że urządzenie z obsługą Kardome może skoncentrować się na jednej osobie w hałaśliwym środowisku i usłyszeć ją tak, jakby mówiła sama w cichym pokoju. Dodatkowo, Cognition AI zapewnia, że system nie tylko słyszy słowa, ale także rozumie, kto je wypowiedział i co znaczą one w kontekście.

Mówi się, że Voice AI ma swoją „chwilę iPhone’a”. Co to znaczy z Twojej perspektywy, i jak blisko jesteśmy do prawdziwej, powszechnej adopcji?

Dla mnie „chwilę iPhone’a” oznacza, że głos jest wreszcie gotowy stać się domyślnym sposobem interakcji z urządzeniami obliczeniowymi.

Widzę, jak producenci wyścigają się, aby zintegrować technologie Voice AI z całymi liniami produktów. Samochody stają się interfejsami głosowymi ze względów bezpieczeństwa. Inteligentne domy potrzebują interfejsów głosowych, ponieważ nie jest możliwe umieszczenie ekranów dotykowych wszędzie. Tradycyjna elektronika również dodaje możliwości głosowe, ponieważ często jest to szybsze niż nawigowanie po menu. Chociaż wiele technologii napędza adopcję głosu, prawdziwa rewolucja zostanie zdeterminowana przez robotykę. Gdy roboty staną się częścią naszych domów i miejsc pracy, głos wyłoni się jako jedyny naprawdę skuteczny i naturalny interfejs do interakcji.

Dla tej bezproblemowej koegzystencji roboty muszą nas rozumieć na poziomie ludzkim. Muszą zrozumieć kontekst i nuans naturalnej mowy, a nie tylko słowa kluczowe. Muszą posiadać świadomość przestrzenną tak precyzyjną, że wydaje się magiczna — instynktownie wiedząc, że ty jesteś tym, który mówi do nich, nawet w hałaśliwym pokoju. Krytycznie, ta inteligencja musi działać na krawędzi dla natychmiastowej, prywatnej i niezawodnej komunikacji.

To nie jest stopniowa poprawa; jest to fundamentalna zmiana w tym, jak ludzie i maszyny będą się komunikować. Budujemy technologię, aby przewodzić tej przebudowie. Powiedziałbym, że jesteśmy około 24 miesięcy od punktu zwrotnego, w którym głos stanie się oczekiwanym interfejsem, a nie funkcją, która byłaby miłym dodatkiem.

W praktycznym sensie, jak widzisz przyszłość słuchu przestrzennego i sztucznej inteligencji w transformowaniu codziennych urządzeń — od samochodów i inteligentnych domów po noszone urządzenia i przestrzenie publiczne?

Przemiana polega na umożliwieniu naturalnej interakcji, gdziekolwiek jesteś, bez konieczności dostosowywania swojego zachowania, aby dostosować się do technologii. W samochodach oznacza to prawdziwie bezręczne sterowanie, które działa podczas jazdy z prędkością autostradową, przy włączonej muzyce i rozmawiających pasażerach. Inteligentne domy stają się naprawdę inteligentne, gdy mogą zrozumieć, kto mówi i skąd, obsługując jednoczesne żądania bez zakłóceń.

Kluczowym spostrzeżeniem jest to, że sztuczna inteligencja słuchu przestrzennego nie tylko poprawia rozpoznawanie głosu — umożliwia całkowicie nowe paradygmaty interakcji. Gdy urządzenia mogą zrozumieć cały akustyczny pejzaż, mogą uczestniczyć w naturalnym przepływie ludzkiej komunikacji, zamiast polegać na sztucznych ograniczeniach. Noszone urządzenia stają się o wiele bardziej użyteczne, gdy mogą izolować twój głos od otaczających rozmów, a przestrzenie publiczne mogą oferować spersonalizowaną, lecz prywatną pomoc głosową. Jak wspomniano w przypadku robotyki, stanowi to fundamentalną zmianę w tym, jak ludzie i maszyny będą się komunikować z robotami, które staną się częścią naszego życia.

Prywatność jest coraz większym problemem w przypadku urządzeń, które są zawsze w trybie nasłuchu. Jak Kardome balansuje pomiędzy zapotrzebowaniem na przetwarzanie na urządzeniu a potrzebą wydajności i dokładności?

Olbrzymia większość obecnych rozwiązań Voice AI działa na hybrydowym modelu, składającym się z komponentu urządzenia (krawędzi) i komponentu opartego na chmurze. Podczas gdy przetwarzanie na krawędzi nie stanowi problemu związanego z prywatnością, ponieważ dane nigdy nie opuszczają urządzenia użytkownika, przetwarzanie w chmurze stanowi znaczące wyzwanie dla prywatności danych.

Kardome odpowiada na to wyzwanie, znacznie rozszerzając możliwości komponentu krawędziowego. Przetwarzając więcej danych lokalnie i zmniejszając zależność od chmury, Kardome zapewnia, że wrażliwe dane głosowe nigdy nie opuszczają urządzenia, oferując lepszą ochronę prywatności w porównaniu z innymi systemami na rynku.

Podstawową troską związaną z urządzeniami „zawsze słuchającymi” nie jest fakt, że mikrofon nagrywa dźwięk, ale ryzyko, że dźwięk ten zostanie przesłany do chmury w celu analizy. W praktyce, ograniczona cena ciągłego przetwarzania w chmurze powoduje, że większość komercyjnych systemów unika tego, co jednak wiąże się z niższą jakością i mniej responsywnym interfejsem głosowym.

Kardome rozwiązuje ten kompromis, wprowadzając potężne, zawsze włączone modele językowe bezpośrednio na urządzeniu. Z naszą technologią, scena akustyczna, naturalna mowa i kontekst są analizowane w czasie rzeczywistym bezpośrednio na urządzeniu. Żadne dane głosowe nie są nigdy przesyłane ani zapisywane. To innowacyjne podejście pozwala Kardome dostarczyć zarówno solidną prywatność danych, jak i wydajny interfejs głosowy, eliminując kompromis, z którym użytkownicy obecnie się spotykają.

Patrząc na branżę w szerszym kontekście, jakie są największe przeszkody, które Voice AI musi jeszcze pokonać, zanim stanie się dominującym interfejsem w całej elektronice konsumenckiej?

Największą przeszkodą jest to, że Voice AI jeszcze nie komunikuje się jak ludzie. Dopóki Voice AI nie będzie w stanie słyszeć i rozumieć jak ludzie, z pełną świadomością kontekstu i zdolnością zrozumienia przepływu rozmowy, nie stanie się podstawowym interfejsem, który ludzie chcą, aby był. Znaczącą przeszkodą techniczną na tym etapie jest to, że większość technologii Voice AI jest oparta na chmurze. To wewnętrznie uniemożliwia ciągłe nasłuchiwanie i tym samym blokuje zrozumienie przepływu rozmowy.

Przełom nastąpi, gdy systemy głosowe będą w stanie prawdziwie zrozumieć kontekst rozmowy i odpowiedzieć z tą samą intuicyjną świadomością, jaką mają ludzie. To będzie moment, kiedy głos stanie się dominującym interfejsem we wszystkich urządzeniach konsumenckich.

Jak myślisz, że relacja konsumentów z asystentami głosowymi ewoluować będzie, gdy zostaną rozwiązane problemy z dokładnością i niezawodnością w hałaśliwych środowiskach?

Gdy tylko niezawodność i naturalna rozmowa zostaną rozwiązane, asystenci głosowi przejdą od cech nowatorskich do niezbędnych interfejsów, na które ludzie będą polegać przez cały dzień. Gdy ludzie wiedzą, że Voice AI zrozumie ich poprawnie za pierwszym razem, nawet w trudnych środowiskach, przestaną dostosowywać się do technologii i zaczną ją używać instynktownie z naturalnym językiem i rozmowami kontekstowymi.

Przyszłość interakcji głosowych będzie przewidywalna i proaktywna. Wyobraź sobie, że twoje urządzenie rozumie nie tylko twoje słowa, ale także twój ton, sygnały emocjonalne i podtekst rozmowy. Obecne systemy mają trudności z naturalnym rytmem rozmowy i nie mogą radzić sobie z przerwaniami, zmianą roli w rozmowie i zrozumieniem kontekstu. Ludzie adaptują się, gdy są przerywani; Voice AI często się myli. Dla producentów OEM wyzwaniem jest integracja Voice AI, która może dostarczyć ten przyszły interfejs bez złożoności i wymagań sprzętowych obecnych rozwiązań.

Wreszcie, jak widzisz Kardome i ekosystem Voice AI za pięć lat, i jakie kamienie milowe będą definiowały, czy naprawdę wkroczyliśmy w erę komputingu opartego na głosie?

Za pięć lat Voice AI będzie tak powszechny jak ekrany dotykowe i klawiatury są dzisiaj, i będzie oczekiwany w zasadzie każdym urządzeniu komputacyjnym. Kardome będzie systemem operacyjnym, który pozwoli użytkownikom obsługiwać swoje urządzenia głosowo, umożliwiając naturalną interakcję z dowolnym urządzeniem w dowolnym środowisku, od robotów po okulary inteligentne, samochody.

Kamieniami milowymi będą zachowania, a nie technologia. Będziemy wiedzieć, że osiągnęliśmy komputing oparty na głosie, gdy ludzie przestaną myśleć o poleceniach głosowych i zaczną prowadzić naturalne rozmowy ze swoim otoczeniem, gdy środowiska wieloużytkowe będą działać bezproblemowo, i gdy dzieci wyrosną, oczekując, że będą mogły mówić do dowolnego urządzenia w naturalny sposób. Ostateczną miarą nie będzie to, jak zaawansowana stanie się nasza technologia, ale jak naturalnie ludzie będą wchodzili w interakcje z cyfrowym światem.

Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Kardome.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.