AI 模型与平台
aiOla推出QUASAR,重新定义语音识别在生产环境中的工作方式

aiOla 推出 QUASAR ,这是一款旨在解决企业语音AI中语音识别性能不一致的问题的平台。与其将客户锁定在单一的 自动语音识别(ASR) 提供商,QUASAR 作为一个智能网关,动态地将每个音频交互路由到最有可能在那一刻表现最佳的ASR引擎。
这种转变很重要,因为语音成为AI驱动工作流的核心输入,涵盖联系中心、合规、分析、搜索和日益增长的自治AI代理。虽然基准评分通常指导ASR的选择,但生产环境受到口音、背景噪音、特定领域的术语和网络质量波动的影响,这些因素会从一次交互到下一次显著改变识别准确率。
为什么一刀切的ASR在规模上会失效
今天,大多数企业将ASR作为静态基础设施决策来部署。根据总体基准评分选择单一提供商,然后将其深度集成到工作流中。在实践中,这会产生盲点。擅长清晰读音的引擎可能难以处理口音或行业特定词汇的发音,而另一个引擎可能处理嘈杂音频很好,但可能会错过用于合规和计费的适当名词或数字序列。
为了解决这些差距而切换提供商是昂贵和破坏性的,通常需要重新训练、重新验证和运营停机。同时,新的ASR模型和更新以一种速度发布,超过了大多数组织测试和采用它们的能力。结果是,容纳率降低、摘要不准确、分析较弱、质量保证开支增加——所有这些都是由可以避免的转录错误引起的。
QUASAR的架构:将ASR视为动态问题
QUASAR将语音识别视为实时优化挑战。在转录之前,每个传入的音频请求都会被评估,考虑诸如说话者特征、声学条件和领域上下文等因素。根据此评估,系统将音频路由到最有可能为该特定交互提供最高质量结果的ASR引擎。
从技术上讲,QUASAR作为一个可以跨商业云API、自托管模型和自定义ASR部署工作的编排层。这种抽象允许企业尝试新的引擎,平衡成本与质量,并避免长期的供应商锁定——所有这些都无需更改下游应用程序。
核心是一个无监督的评估和排名机制,它实时评分ASR选项。与其仅依赖历史平均值,系统从实时条件中持续学习,实现转录决策可以适应环境、说话者和用例的演变。
在现实音频条件下的性能
在内部评估中,QUASAR跨六个不同基准数据集(从清晰读音和专业演讲到口音、嘈杂和领域特定金融音频)选择了最好的ASR选项,总体准确率达到88.8%,或当结果有效时相当于最佳选择。在清晰语音上,准确率最高可达97%,在涉及口音、噪音和专业词汇的更具挑战性的音频中,准确率保持在79-88%的范围内。
这些结果突出了一个关键见解:没有单一的ASR引擎能够在所有场景中始终获胜,但智能路由可以利用多个引擎的优势。
使语音成为活跃基础设施
通过解除语音识别质量与固定提供商之间的耦合,QUASAR使ASR成为aiOla所描述的“活跃基础设施”。企业可以在交互级别上获得对转录性能的细粒度可见性,并根据用例优化准确率、成本或延迟。
这种方法还加速了进入新地区和垂直市场的速度。组织无需等待单一供应商支持某种语言、口音或行业特定词汇,而可以将流量路由到最适合当前市场的引擎,并在更好的选项出现时切换。
aiOla对语音驱动工作流的更广泛愿景
QUASAR建立在aiOla更广泛的使语音成为企业系统自然界面的使命之上。该公司的专利模型超越了标准的语音转文本,通过将语音识别与工作流智能相结合,将口语输入转换为结构化的实时数据。这使得在手动数据输入仍然是瓶颈的关键行业中实现无手自动化成为可能。
在获得 5800万美元的资金 和一个研究驱动的团队的支持下,aiOla将语音不仅仅视为输入模式,而是将其视为AI驱动运营的基础设施。通过QUASAR,公司将这一愿景扩展到ASR层本身,挑战了人们对如何在规模上部署语音识别的长期假设。
随着语音成为AI代理和企业系统的主要界面,动态、上下文感知的语音识别可能会变得至关重要。QUASAR的推出标志着从静态模型选择向自适应、性能驱动的编排转变——这种方法可能会重塑整个语音AI生态系统对ASR的消费方式。












