思想领袖

语音 AI 中的真实与空想

mm
将 Unite.AI 添加到您在 Google 上的首选来源

在2024年,如果你拨打公司的客服热线并被转接到“语音代理”,你会在前几秒就知道自己在和机器对话。你的问题与答案之间出现几秒的沉默,显而易见对方是软件。两年后,数十亿美元的资金投入后,这些明显的迹象正逐渐消失。如今最优秀的语音 AI 系统已经足够出色,人们在盲测中不再偶尔而是经常辨认不出它们。按照大多数通用定义,我们正看到语音 AI 在现实中通过了图灵测试

但这一里程碑值得审视,因为类似的宣称往往缺乏细节。每当一项技术跨越这样的门槛时,它的营销主张常常跑在工程能力前面,语音 AI 也不例外。我花了近两年的时间构建文本转语音和语音转语音模型,拜访企业买家评估十余家供应商,几乎听到相同的宣称。其中一些经得起审查,但大多数仍有相当距离。在语音 AI 领域,以下是我在与客户交流时最常遇到的七大误区。

Myth #1: Bigger Models Don’t Make Voice AI More Human

行业的默认假设是规模可以解决一切:把更大的语言模型投入问题,代理就会更像人。但事实并非如此,因为人类并不像模型处理提示那样进行对话,我们会在思考中途打断而不是等完整句子结束。一个等待、处理后才回应的语音代理,无论输出多么流畅,都显得机械,因为时机才是关键,而不是词汇量。能够实时处理日常对话的更小、更专用的模型往往听起来更像人,只在必要时升级,同时保持足够的敏捷以跟上来电者的节奏。

Myth #2: “We Handle 90% of Calls” Usually Means Containment, Not Resolution

语音 AI 仍然依赖特定基准来评估性能,而“呼叫容留率”可能是最具误导性的指标。该指标衡量语音 AI 在无需人工介入的情况下处理的通话比例,并且之所以被广泛使用,是因为几乎没有人会追问一个显而易见的后续问题:这些被容留的通话真的得到了解决吗?如果客户没有被转接给人工,这通话就算是“容留”,只有问题真正被解决才算“解决”。供应商倾向于强调容留率,因为数字更大,但它并不能说明部署是否有效。这种脱节正是企业在语音 AI 推广中失望的根源。向任何供应商索要解决率,而不是容留率,你会看到对话的转变。

Myth #3: Human-Like Voice AI That Fabricates Answers Is Worse Than Robotic AI That Doesn’t

令人欣喜的是,听起来逼真的 AI 能让语音交互感觉自然,而不是机械。但真正的目标是将这种人性化的温度与准确性结合起来,因为一个听起来像人的、始终正确的语音系统必然胜过仅仅听起来像人的系统。缺乏依据的语音模型仅依赖内部训练记忆,可能在15% 到 30% 的真实通话中产生幻觉。将每一次响应都基于真实的客户和后台数据,而不是让模型即兴发挥的语音 AI 系统,更不容易自信地向来电者提供错误信息,误导他们。如果供应商无法解释其系统如何控制幻觉,那么你得到的只是半套方案。

Myth #4: Intelligence for Voice Is About What You *Don’t* Store, Not What You Do

ChatGPT 的出现让科技行业普遍认为,更多的参数和更多的训练数据必然带来更强、更好的智能。但这并非人类智能的工作方式,也因此并非语音 AI 应该遵循的模型。我们不会保留每一条听过的信息,而是只保留重要的部分,其余则舍弃。如今的大型语言模型恰恰相反:它们把所有信息都压缩进自身——这也是数据中心需求激增的原因之一。但对于绝大多数真实的语音使用场景,如客户支持、转录、结构化对话等,专注的小模型往往在成本、延迟,甚至准确性上都能胜过拥有万亿参数的通用模型。

Myth #5: Full Replacement of Human Agents vs Knowing Your Limits

显而易见,没有人希望 AI 语音假装自信,只是为了掩盖它不知道的事实。这也是能够真正提供价值的部署会模仿优秀人类员工的工作方式:他们能够立刻处理自己熟悉的事务,而在遇到陌生领域或棘手客户时,会立刻发出警示,将通话置于简短自然的保持状态,并升级到更大的模型或人工座席。目标绝不应是100% 自动化。理想的设置是让代理实时识别自身能力的边界,因为这才是大规模部署时真正安全的做法。

Myth #6: Voice Doesn’t Kill Every Other Interface, It Augments What We Already Use

人们常假设,一旦语音 AI 足够优秀,打字和屏幕就会逐渐消失。我并不认为我们正走向零输入的时代,屏幕也不会消失;人们仍然需要它们来观看视频、浏览仪表盘或进行视觉审查。变化在于,我们日常与机器的交互将有更多转向语音,就像人与人之间的对话那样,叠加在仍然有意义的界面之上。语音不会取代一切,它只会在更多场景下成为默认选项。

Myth #7: Stitching an LLM to an Off-the-Shelf Text-to-Speech API Counts as a Voice Agent

随着语音 AI 成为消费品牌的差异化因素,许多“语音代理包装器”——即在现有基础设施之上添加品牌或计费服务的层——在演示中看起来很吸引人,却很少能在真实呼叫中心的高并发下存活。将语音转文本、语言模型和文本转语音串联会在每一次交接时累积延迟。真正能在规模化时维系系统的不是 API 层,而是管道在负载下的单元经济学以及芯片层面的优化,以保持高速且成本可控。这是大多数包装器跳过的非光鲜工作,也将决定下一代客户体验的走向。

The Line That Matters

每一次炒作周期最终都会形成自己的评判标准,区分谁是认真的参与者,谁只是搭便车。随着语音界面越来越难以与另一端的人类区分,系统是仅仅“听起来可信”,还是实际上“可信”,这一差别将比现在重要得多。那些现在把它当作工程学科而非营销检查项来对待的公司,才是当新鲜感消退后仍能赢得客户信任的企业。

Sudarshan Kamath 是 Smallest AI 的联合创始人兼首席执行官,该公司于 2023 年由他创立,旨在让语音 AI 快速、经济且大规模可获取。作为 IIT Guwahati 的毕业生,他在构建 AI 产品方面已有十余年经验。Sudarshan 负责公司整体愿景、方向和长期战略。