访谈
Kardome 首席执行官兼联合创始人 Dani Cherkassky – 采访系列

Dani Cherkassky,Kardome 首席执行官兼联合创始人,在声学、信号处理和算法开发方面拥有二十多年的经验。他在创立 Kardome 之前,曾担任 Silentium Ltd. 的首席技术官,领导了与一线公司和研究机构的研发合作。凭借巴伊兰大学的麦克风阵列处理博士学位,Cherkassky 将深厚的技术专长与明确的使命相结合 —— 通过创造真正倾听人们而不是周围噪音的技术,消除现代语音交互的挫败感。
Kardome 是一家开创性地推动 AI 驱动的空间听觉解决方案的公司,能够在任何环境中提供清晰、个性化的语音交互 —— 从汽车和会议室到智能家居和公共空间。其专有的语音聚类技术可以根据位置分离语音,使设备能够像只有一个人在说话一样理解每个说话者。Kardome 的平台被设计为与硬件无关且边缘就绪,能够提高语音识别的准确性、安全性和用户体验,推动人机通信的下一代发展。
是什么启发你和 Dr. Alon Slapak 共同创立 Kardome?
Kardome 的灵感来自我们对语音和音频的迷恋和挫败感。凭借我们在学术和工业界的背景,我们对语音识别的进步感到兴奋,尤其是在深度神经网络出现后。
在一个安静的实验室中,技术是非常出色的。但是,一旦你步入现实世界,那种魔力就会消失。我们观察到,在一个嘈杂的汽车、一个繁忙的办公室或一个混乱的家中,先进的系统几乎不比 1990 年代的技术更好。这是进步的巨大障碍。
语音是与设备交互的最自然的方式,是触摸屏的真正继任者。但是,要实现这一点,技术需要克服现实生活中的混乱。我们决定使其成为我们的使命。我们在车库里花了一个年头,纠结于声波传播方程和测试新想法,直到我们取得了突破:现在被称为 Kardome 空间听觉技术的第一个演示。
在那一刻,我们知道我们已经掌握了关键。我们创立 Kardome 不仅仅是为了构建一个产品,而是为了启动人类和机器之间通信方式的革命。
许多语音助手在语音重叠或背景噪音占据主导地位时会挣扎和经常让用户感到沮丧。为什么传统方法在这些现实世界条件下表现如此糟糕?
传统的语音 UI 在现实世界中表现糟糕,因为它们的软件依赖于一种过于简单的方法来理解声音。大多数系统使用多个麦克风来确定声音的到达方向,这种方法只关注声音的角度,而忽略其他关键的 3D 空间信息。这种方法在任何现实世界环境中都会立即失败 —— 比如汽车、办公室或客厅 —— 因为这些环境充满了回声,声音波会从每个反射表面上弹回。对于只理解方向的系统来说,每一个这样的反射都会被感知为来自不同位置的新声音。
这会产生一种令人迷惑的效果,就像设备处于“声学镜厅”中,一个声音似乎来自数百个方向。系统无法区分说话者的不同声音和回声的风暴,因此无法正确解码声音。这种根本限制正是为什么当前的语音技术在现实世界、混乱的场景中具有如此糟糕的音频感知,并最终无法可靠地执行的原因。
Kardome 的技术将每个人视为房间中唯一的说话者。是什么技术突破使得这一点成为可能,它与传统的远场语音识别有何不同?
我们的技术突破是一种专有的技术,称为空间听觉 AI,它超越了传统的只检测声音方向的方法,而是确定声音在三维空间中的精确位置。它通过分析声音在房间内创建的整个反射模式,利用声音从表面弹回的复杂方式作为特定位置的唯一“声学指纹”。我们的 AI 即时且被动地推断每个声音源的指纹,有效地绘制环境。这种基于位置的方法与传统的基于方向的系统根本不同,后者很容易被我们用作有价值数据的反射所混淆。虽然它们听到一个说话者时会听到一群回声,但我们的技术利用完整的反射模式来确定实际源。实际结果是 Kardome 启用的设备可以在嘈杂的环境中专注于一个人,并听到他们的说话声,就像他们在安静的房间中独自说话一样。另外,认知 AI 确保系统不仅听到文字,还理解谁说了什么以及在什么上下文中意味着什么。
有人说语音 AI 正在经历其“iPhone 时刻”。从您的角度来看,这是什么意思,我们距离真正的主流采用还有多远?
对我来说,“iPhone 时刻”意味着语音终于准备好成为我们与计算设备交互的默认方式。
我看到制造商正在竞相将语音 AI 技术集成到整个产品线中。汽车正在成为安全原因的语音优先界面。智能家居需要语音用户界面,因为在每个地方放置触摸屏是不切实际的。传统电子设备也在添加语音功能,因为这通常比导航菜单更快。虽然许多技术都在推动语音的采用,但真正的革命将由机器人决定。当机器人融入我们的家园和工作场所时,语音将成为与它们交互的唯一真正有效且自然的界面。
为了实现无缝的共存,机器人必须以人类的方式理解我们。他们需要理解自然语音的背景和细微差别,并能够理解对话流程。他们需要一种空间意识,使其感觉像魔术一样 —— 直觉地知道 你 正在与 他们 交谈,即使在嘈杂的房间中。关键的是,这种智能必须在边缘运行,以实现即时的、私有的和可靠的通信。
这不是渐进式的改进;这是人类和机器之间交互方式的根本转变。我们正在建设这种重新定义的技术。我认为我们距离语音成为预期的界面而不是很好的功能只有大约 24 个月的时间。
从实际角度来看,您如何看待空间听觉和认知 AI 转变日常设备 —— 从汽车和智能家居到可穿戴设备和公共空间?
转变是关于使自然交互无处不在,无论你在哪里,都不需要改变你的行为来适应技术。在汽车中,这意味着真正的无手控制,即使在高速行驶、音乐播放和乘客交谈时也能正常工作。智能家居真正变得智能,因为它们可以理解谁正在说话以及从哪里说话,并在没有混淆的情况下处理同时的请求。
关键的洞察是,空间听觉 AI 不仅改进了语音识别 —— 它还使得全新的交互模式成为可能。当设备能够理解整个音频场景时,它们可以参与人类交流的自然流程,而不是依赖于人为的约束。可穿戴设备变得更加有用,因为它们可以从周围的对话中分离出你的声音,并且公共空间可以提供个性化但私人的语音助手。正如我之前提到的,对于机器人来说,这代表了人类和机器之间交互方式的根本转变,当机器人成为我们生活的一部分时。
隐私是始终监听设备的日益增长的担忧。Kardome 如何平衡对设备处理的需求与性能和准确性的需求?
今天的大多数语音 AI 解决方案都采用混合模型,包括边缘组件和基于云的组件。虽然边缘处理不会引起任何隐私问题,因为数据永远不会离开用户的设备,但云处理却带来了显著的数据隐私挑战。
Kardome 通过显著扩展边缘组件的功能来解决这一挑战。通过在本地处理更多数据并减少对云的依赖,Kardome 确保敏感的语音数据永远不会离开设备,从而提供比其他市场上的系统更好的隐私保护。
“始终监听”设备的主要问题不是麦克风捕获音频,而是音频被上传到云端进行分析的风险。在实践中,连续云处理的高昂成本意味着大多数商业系统都避免这样做,但这却以牺牲质量和响应速度为代价。
Kardome 通过将强大的、始终开启的语言模型带到边缘设备本身来解决这一权衡。使用我们的技术,音频场景、自然语音和上下文都在设备上实时分析。没有任何语音数据被上传或保存。这种创新方法使 Kardome 能够提供强大的数据隐私和高效的语音 UI,消除了用户目前面临的妥协。
从行业的角度来看,语音 AI 仍然需要克服哪些最大障碍才能成为消费电子领域的主导界面?
语音 AI 仍然没有像人类一样进行交流。直到语音 AI 能够像人类一样听到和理解,具有完整的上下文意识和对话流程的理解,它才不会成为人们期望的主要界面。当前的一个重大技术障碍是,大多数语音 AI 技术都是基于云的。这本质上阻止了连续监听,并因此阻止了对话流程的理解。
突破将会在语音系统能够真正理解对话背景并以与人类相同的直觉意识做出响应时到来。那时,语音将成为消费电子领域的主导界面。
您认为一旦在嘈杂环境中解决了准确性和可靠性问题,消费者与语音助手的关系将如何演变?
一旦可靠性和自然对话得到解决,语音助手将从新奇功能转变为人们在一天中依赖的基本界面。当人们知道语音 AI 会正确理解他们,即使在具有挑战性的环境中,他们也会停止适应技术,并开始本能地使用自然语言和上下文对话。
语音交互的未来将是预测性和主动性的。想象一下您的设备不仅理解您的言语,还理解您的语气、情感线索和对话的微妙之处。当前的系统在处理对话的自然节奏时挣扎,无法处理中断、轮流和上下文理解。人类在被打断时会适应;语音 AI 通常会变得混乱。对于 OEM 来说,挑战是集成能够提供这种未来界面的语音 AI,而不需要当前解决方案的复杂性和硬件要求。
最后,您五年后如何看待 Kardome 和语音 AI 生态系统?哪些里程碑将决定我们是否真正进入了语音优先计算的时代?
五年后,语音 AI 将像触摸屏和键盘一样无处不在,并且在几乎所有计算设备中都将被视为必备功能。Kardome 将成为允许用户通过语音操作其设备的操作系统,实现任何环境中的自然交互 —— 从机器人到智能眼镜、汽车等等。
决定性里程碑将是行为上的,而不是技术上的。我们将知道我们已经实现了语音优先计算,当人们停止思考语音命令并开始与环境进行自然对话,当多用户环境无缝地工作,以及当孩子们长大后期望能够自然地与任何设备交谈时。最终的衡量标准将不是我们的技术变得多么复杂,而是人类与数字世界交互的自然程度。
感谢这次精彩的采访,希望了解更多的读者可以访问 Kardome。












