融资
Modulate 获得 $25M 融资,以构建语音 AI 的智能层

Modulate 获得了 $25 million 的新融资,波士顿总部的公司希望抓住人工智能日益增长的挑战:让机器不仅理解人们说了什么,还能理解他们的说话方式。
Future Ventures 主导了本轮融资,Hyperplane 和 Lakestar 也参与其中。此次融资使 Modulate 的累计融资额达到 $60 million,资金将用于扩大其 AI 研究、工程团队、开发者工具、合作伙伴关系以及部署选项。
此项投资恰逢语音日益成为 AI 代理、客户服务平台、游戏环境和安全系统的交互界面。尽管语音转文本技术已经显著提升,Modulate 认为仅靠转录文本会遗漏大量人类语音中包含的信息。
其技术直接分析底层音频,捕捉情感、语调、意图、停顿、合成语音以及对话行为等信号。
超越语音转文本
当今大多数语音 AI 体系结构遵循相对简单的流程:将语音转换为文本,然后将生成的转录发送给大型语言模型(LLM)。
当词语本身包含大部分相关信息时,这种方式效果良好。但当意义取决于讽刺、沮丧、犹豫、压力、打断或语调变化时,它的局限性就会显现。
Modulate 围绕这样一个理念构建了其旗舰 Velma 平台:这些信号应直接从音频中分析,而不是事后从转录文本中重建。
公司将 Velma 描述为一种音频原生的对话智能系统,能够在生成转录的同时识别说话者、情感、对话主题、情绪以及超过 150 种行为。开发者还可以使用自然语言描述来定义自定义行为。
这使得该技术可用于多种场景,从在通话恶化前识别沮丧的客户,到在金融交易期间检测可疑行为,或发现 AI 语音代理出现异常行为。
今年六月,Modulate 通过 API 将 Velma 直接向开发者开放,扩大了其在早期企业部署之外的访问范围。
Modulate 采用集成方法推进音频 AI
Velma 背后的架构是 Modulate 所称的 集成聆听模型,即 ELM。
ELM 并非使用单一庞大模型完成所有任务,而是协调超过 100 个专用模型,各组件分析音频流的不同特征。
这些模型能够同时检查说话人切换、停顿等基础属性,以及情感、感知意图、合成语音标记、困惑或行为模式等高级信号。随后,一个编排层将这些观察结果整合为对话的更宏观解释。
这与日益流行的将更大多模态基础模型应用于音频的策略截然不同。
Modulate 认为,专门化使其架构能够提供更透明的输出,同时降低计算需求。对于欺诈检测和合规等企业应用,了解系统为何触发警报的原因几乎与警报本身同等重要。
公司称,与使用单一大型模型相比,该方法在某些音频分析工作负载上可提升至 1,000 倍的计算效率。
语音 AI 带来新的监控难题
此次融资的时机也反映了企业 AI 正在发生的更广泛转变。
AI 系统日益能够与客户进行完整的语音对话。这意味着企业必须监控的交互对象不仅包括人工员工,还包括在成千上万甚至数百万对话中运行的自主代理。
语音代理虽然在技术上遵循脚本,却可能频繁打断客户、未能识别沮丧、误解意图,或在情绪化场景中回应不当。
Modulate 看到一个机会,即成为独立的聆听层,置于这些代理旁边。
其语音代理技术旨在识别中断、停顿、情感、口音等仅凭文本难以捕捉的信号,使开发者能够在对话进行时调整代理的行为。
同样的基础设施也可用于人类对话,帮助组织实时识别欺诈、合规风险、骚扰或其他潜在重要事件。
从游戏监管到更广泛的语音智能
Modulate 目前的雄心标志着相较于其早期专注于在线游戏的显著扩张。
其最知名的产品之一,ToxMod,旨在分析游戏和社交平台上的实时语音通信,并识别骚扰、威胁、诱导以及其他有害行为。
这仍然是业务的重要组成部分。Modulate 表示,ToxMod 能够直接与现有语音基础设施集成,同时将可能出现问题的交互转至审核系统或人工审查员。
该公司已与包括 Activision、Riot Games、Rockstar Games 和 Rec Room 在内的主要游戏公司合作。
然而,理解多人游戏中有害言论所需的底层技术也可以适用于其他情境关键的环境。
Modulate 现在将其技术布局于欺诈防护、联络中心、AI 代理监督、深度伪造检测、客户体验以及信任与安全等领域。
其开发者平台目前提供多种模型系列,涵盖转录、深度伪造检测、音频编辑、对话智能以及其他音频分析功能。
深度伪造为直接理解音频提供了另一理由
Synthetic speech 正在成为该机遇的另一重要组成部分。
随着越来越逼真的语音克隆技术出现,处理金融交易或敏感信息的组织需要判断的不仅是来电者的内容,还要确认声音本身是否真实。
因此,Modulate 已扩展至深度伪造检测,将合成语音分析与其音频模型提供的更广泛上下文信息相结合。
该公司称,其技术目前每月分析超过 1000 万小时的音频,累计已处理超过 6 亿小时。
其向 AI 生成音乐检测等领域的扩展也说明了底层集成架构的广泛潜在应用。例如,Modulate 的音乐检测系统会分别评估音乐的存在、AI 生成的声乐以及 AI 生成的乐器声部,然后将这些信号合并为可解释的结果。
语音 AI 的下一个挑战是理解,而非发声
这笔 2500 万美元的投资为 Modulate 提供了额外资源,以扩展其研究、工程、开发者工具和合作伙伴关系。更广泛地说,这反映了语音 AI 正面临的日益增长的挑战:自然发声仅是对话的一半。
随着语音代理进入客户服务、医疗保健、金融服务等领域,系统需要理解转录常常遗漏的信号,包括挫败感、犹豫、强调、语调以及可能的合成语音。
这可能在语音交互周围创建一个新的智能层,帮助系统检测欺诈、识别客户不满,或发现 AI 代理误解或处理不当对话的情况。
但该技术也引发了隐私、准确性和偏见方面的问题。从语音推断情感或意图比转录文字更具主观性,尤其是在不同口音、语言和文化之间。
随着 AI 越来越能够像人类一样说话,下一个前沿可能是评估机器实际倾听的能力——以及这些能力的使用是否负责任。












