인터뷰
카도미의 다니 체르카스키 CEO 및 공동 창립자 – 인터뷰 시리즈

다니 체르카스키, 카도미의 CEO 및 공동 창립자는 음향, 신호 처리 및 알고리즘 개발 분야에서 20년 이상의 경험을 보유하고 있으며 음성 기술 혁신의 최전선에 있습니다. 카도미를 창립하기 전에 그는 Silentium Ltd.의 CTO로 재직하며 Tier 1 회사와 연구 기관과의 R&D 협력을 주도했습니다. 바일란 대학에서 마이크로폰 어레이 처리에 대한 박사 학위를 취득한 체르카스키는 깊은 기술 전문 지식과 현대 음성 상호작용의 불편함을 없애기 위한 명확한 임무를 결합했습니다. 즉, 사람들이 주변 소음을 듣지 않고 사람들을 듣는 기술을 창조하는 것입니다.
카도미는 모든 환경에서 개인화된 음성 상호작용을 제공하는 AI 기반 공간 청각 솔루션을 개척하고 있습니다. 즉, 자동차, 회의실, 스마트 홈, 공공 장소 등에서 명확한 음성을 제공합니다. 카도미의 독자적인 음성 클러스터링 기술은 위치에 따라 음성을 분리하여 장치가 각 화자에게만 집중할 수 있도록 합니다. 하드웨어에 구애받지 않고 에지에서 작동하도록 설계된 카도미의 플랫폼은 음성 인식 정확도, 보안, 사용자 경험을 향상시키며 인간과 기계의 다음 세대 통신을 구동합니다.
당신과 알론 슬라팍 박사가 카도미를 공동 창립하기로 결정한 계기는 무엇입니까?
카도미의 영감은 음성 및 오디오 분야에서 학계와 산업계에서 활동한 경험에서 비롯되었습니다. 특히 딥 뉴럴 네트워크가 등장하면서 음성 인식 기술의 발전이 놀라웠습니다.
조용한 연구실에서 기술은 현상이었다. 그러나 현실 세계로 나아가면 그 마법은 사라졌습니다. 우리는 자동차, 사무실, 집 등에서 최신 기술이 1990년대 기술과 거의 차이가 없다는 것을 관찰했습니다. 이것이 진보의 큰 장벽이었습니다.
음성은 장치와 상호작용하는 가장 자연스러운 방법이며 터치스크린의 후계자입니다. 그러나 이를 위해서는 기술이 현실 세계의 혼란을 극복해야 합니다. 우리는 이를 우리의 임무로 결정했습니다. 우리는 1년 동안 차고에서 음파 전파 방정식과 새로운 아이디어를 테스트하면서 Spatial Hearing Technology로 알려진 것을 처음으로 시연했습니다.
그 순간, 우리는 열쇠를 찾았다고 생각했습니다. 우리는 단순히 제품을 구축하기 위해 카도미를 창립하지 않았습니다. 인간과 기계가 통신하는 방식을 혁신하기 위해 창립했습니다.
많은 음성 보조기는 음성이 중첩되거나 배경 소음이 지배할 때 사용자에게 어려움을 겪고 좌절감을 느끼게 합니다. 왜 이러한 현실 세계 조건에서 전통적인 방법이 इतन 못할까요?
전통적인 음성 UI는 현실 세계에서 잘 작동하지 않습니다. 그 이유는 소프트웨어가 음성을 이해하는 데 너무 단순한 방법을 사용하기 때문입니다. 대부분의 시스템은 음향의 방향을 결정하기 위해 여러 마이크를 사용합니다. 그러나 이 방법은 실제 환경에서 즉시 실패합니다. 예를 들어, 자동차, 사무실, 거실과 같은 환경은 모든 반사 표면에서 음파가 반사되는 반향으로 가득 차 있습니다. 방향만을 이해하는 시스템에서는 이러한 반향이 새로운 음성으로 인식됩니다.
이로 인해 방향 감각을 잃는 효과가 발생합니다. 즉, 장치는 ‘음향 거울’의 방에서 있는 것처럼 сот 개의 방향에서 오는 음성으로 인식합니다. 시스템은 음성의 혼란스러운 음향 풍경을 올바르게 해석할 수 없습니다. 이것이 현재 음성 기술이 현실 세계의 혼란스러운 시나리오에서 इतन 잘못된 음향 인식을 가지게 되는 이유입니다.
카도미의 기술은 각 사람을 방에서 유일한 화자로 취급합니다. 이것을 가능하게 하는 기술적인 돌파구는 무엇이며, 어떻게 전통적인远거리 음성 인식과 다릅니까?
우리의 기술적인 돌파구는 Spatial Hearing AI입니다. 이는 음성의 방향만을 감지하는 전통적인 방법과 달리, 3차원 공간에서 음성의 정확한 위치를 감지합니다. 이는 음성이 방 안에서 생성하는 음향 패턴을 분석하여 음성의 위치를 파악합니다. 이 위치 기반 접근법은 방향 중심의 시스템과 근본적으로 다릅니다. 전통적인 시스템은 음향의 반향에 쉽게 혼란을 겪습니다. 그러나 카도미의 기술은 이러한 반향을 이용하여 음성의 실제 위치를 파악합니다. 실제 결과는 카도미가 활성화된 장치가 시끄러운 환경에서 한 사람의 음성을 집중해서 듣고, 조용한 방에서 혼자 말하는 것처럼 들을 수 있습니다. 또한, 인지 AI는 시스템이 단순히 음성을 듣는 것이 아니라, 누가 말했는지, 무엇을 의미하는지 이해할 수 있도록 합니다.
음성 AI는 “아이폰의 순간”을 맞이하고 있다고 합니다. 당신의 관점에서 이것이 무엇을 의미하며, 우리는 진정한 대중적 채택에 얼마나 가까이 있습니까?
아이폰의 순간은 음성이 컴퓨팅 장치와 상호작용하는 기본 방법이 될 것임을 의미합니다.
제조업체들이 음성 AI 기술을 전체 제품 라인에 통합하는 것을 보며, 자동차는 안전을 위해 음성 우선 인터페이스를 채택하고 있습니다. 스마트 홈은 음성 사용자 인터페이스를 필요로 하며, 전통적인 전자 제품은 음성 기능을 추가하고 있습니다. 실제로 음성 AI는 로봇 기술의 발전과 함께 진정한 혁신을 가져올 것입니다. 로봇이 우리의 집과 작업장에 통합되면 음성은 로봇과 상호작용하는唯一真正有效한 인터페이스가 될 것입니다.
이러한 상호작용을 무결하게 하려면 로봇은 인간과 같은 수준으로 우리를 이해해야 합니다. 로봇은 자연스러운 음성의 맥락과ニュアンス를 이해해야 하며, 시끄러운 방에서도 음성을 정확하게 인식할 수 있어야 합니다. 또한, 로봇은 즉각적이고 사적인 통신을 위해 에지에서 작동해야 합니다.
이것은渐进적인 개선이 아니라, 인간과 기계가 상호작용하는 방식의 근본적인 변화입니다. 우리는 이러한 재정의를 주도하는 기술을 구축하고 있습니다. 우리는 진정한 대중적 채택의 임계점에 24개월 정도 남아 있다고 생각합니다.
실제적으로, 공간 청각과 인지 AI는 자동차, 스마트 홈, 웨어러블, 공공 장소와 같은 일상적인 장치에 어떻게 변화를 가져올까요?
변화는 기술을 사용하기 위해 행동을 변경할 필요 없이 자연스럽게 상호작용할 수 있게 하는 것입니다. 자동차에서는高速 도로에서 음악을 들으며 동승자와 대화하는 동안真正한 무손실 제어를 의미합니다. 스마트 홈은真正한 지능을 갖추게 되어, 여러 요청을同时 처리할 수 있습니다.
중요한 통찰은 공간 청각 AI가 음성 인식을 개선하는 것뿐만 아니라, 완전히 새로운 상호작용 패러다임을 가능하게 합니다. 장치가 전체 음향 장면을 이해할 수 있다면, 자연스러운 인간의 통신 흐름에 참여할 수 있습니다. 웨어러블은 주변 대화에서 사용자의 음성을 분리할 수 있게 되어 훨씬 더 유용해집니다. 공공 장소에서는 개인화된 음성 지원을 제공할 수 있습니다.
개인 정보 보호는 항상 듣는 장치에서 증가하는 문제입니다. 카도미는 성능과 정확성의需求과 에지 처리의需求을 어떻게 균형시킵니까?
오늘날의 대부분의 음성 AI 솔루션은 에지 구성 요소와 클라우드 기반 구성 요소의 하이브리드 모델을 사용합니다. 에지 처리는 사용자 데이터가 장치에서离开하지 않기 때문에 개인 정보 보호에 대한 문제가 없습니다.
카도미는 에지 구성 요소의 기능을 크게 확장하여 클라우드에 의존하는 것을 줄이고, 사용자 데이터가 장치에서离开하지 않도록 하여, 다른 시스템보다 우수한 개인 정보 보호를 제공합니다.
“항상 듣는” 장치의 주요 문제는 마이크가 오디오를 캡처하는 것이 아니라, 오디오가 클라우드에 업로드되어 분석되는 것입니다. 대부분의 상업적 시스템은 지속적인 클라우드 처리의 비용으로 인해 이를 피합니다. 그러나 이는 낮은 품질과 반응성이 느린 음성 UI로 이어집니다.
카도미는 강력한 언어 모델을 에지 장치 자체에 가져옵니다. 카도미의 기술은 음향 장면, 자연스러운 음성, 맥락을 모두 실시간으로 장치에서 분석합니다. 음성 데이터는 절대로 업로드되거나 저장되지 않습니다. 이 혁신적인 접근법은 카도미가 강력한 데이터 개인 정보 보호와 효율적인 음성 UI를 모두 제공할 수 있도록 합니다.
산업 전반적으로, 음성 AI가 소비자 전자 제품 전체에 걸쳐 지배적인 인터페이스가 되기 위해 여전히 극복해야 할 가장 큰 장벽은 무엇입니까?
음성 AI가 인간과 같은 수준으로 통신하지 못하는 것입니다. 음성 AI가 인간과 같은 맥락과ニュアンス를 이해하고, 대화의 흐름을 이해할 수 있을 때, 그것이真正한 기본 인터페이스가 될 것입니다. 현재 음성 기술의 대부분은 클라우드 기반입니다. 이것은 지속적인 듣기를 방해하며, 따라서 대화의 흐름을 이해하는 것을 방해합니다.
돌파구는 음성 시스템이 인간과 같은 수준으로 통신할 수 있을 때 일어날 것입니다. 즉, 음성 AI가 맥락과뉴아ンス를 이해하고, 인간과 같은 수준으로 반응할 수 있을 때, 음성이真正한 기본 인터페이스가 될 것입니다.
음성 보조기가 시끄러운 환경에서 정확하고 신뢰할 수 있게 되면, 사용자와 음성 보조기との 관계는 어떻게 변화할까요?
음성 보조기가 정확하고 신뢰할 수 있게 되면, 사용자는 기술을 사용하기 위해 행동을 변경할 필요 없이 자연스럽게 상호작용할 수 있게 될 것입니다. 사용자는 음성 AI가 처음부터 정확하게 이해할 것이라는 것을 알게 되면, 기술을 사용하기 위해 행동을 변경할 필요 없이 자연스럽게 음성을 사용하게 될 것입니다.
음성 상호작용의 미래는 예측적이고 적극적일 것입니다. 사용자의 음성, 톤, 감정적인 신호, 맥락적인 대화를 이해하는 장치를 상상해 보세요. 현재 시스템은 자연스러운 대화의 리듬에 어려움을 겪고, 중단, 순서 변경, 맥락 이해를 처리하지 못합니다. 인간은 중단에 적응하지만, 음성 AI는 혼란스러워할 수 있습니다. 제조업체들은 이러한 미래의 인터페이스를 제공하는 음성 AI를 통합하는 데 어려움을 겪을 것입니다.
마지막으로, 5년 후에 카도미와 음성 AI 생태계는 어떻게 될까요? 그리고 우리는真正한 음성 우선 컴퓨팅의 시대에 들어섰는지 어떻게 알 수 있을까요?
5년 후, 음성 AI는 오늘날 터치스크린과 키보드와 같은 모든 컴퓨팅 장치에서 기대되는 기능이 될 것입니다. 카도미는 사용자가 음성으로 장치를 제어할 수 있는 운영 체제가 될 것입니다. 즉, 로봇, 스마트 글래스, 자동차 등 모든 환경에서 자연스러운 상호작용을 가능하게 할 것입니다.
정의하는 里程碑은 기술적인 것이 아니라, 행동적인 것입니다. 우리는 사람들이 음성 명령에 대해 생각하지 않고, 환경과 자연스럽게 대화할 때, 여러 사용자 환경이 원활하게 작동할 때, 어린이들이 모든 장치와 자연스럽게 대화할 때, 우리는真正한 음성 우선 컴퓨팅의 시대에 들어섰음을 알 수 있을 것입니다. 궁극적인 측정은 우리의 기술이 얼마나 정교해졌는지가 아니라, 인간이 디지털 세계와 얼마나 자연스럽게 상호작용하는지입니다.
감사합니다. 더 많은 정보를 원하는 독자는 카도미를 방문하시기 바랍니다.












