AI 模型与平台

AudioShake 推出 The Refinery,将重叠对话转化为 AI 训练数据

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Conceptual illustration of overlapping sound waves separating into individual audio tracks for AI training.

人们会打断对话。他们会在别人最后一句话上笑出声,在说话者还未说完时快速表示同意,并在音乐或交通噪音充斥背景时继续说话。对于语音 AI 开发者来说,这种日常的混乱会导致一个棘手的数据问题:录音可能恰好包含模型需要学习的对话行为,却以单一的混合音频流呈现。

AudioShake 正在通过 The Refinery 填补这一空白,这是一款新推出的系统,可将现有录音转换为结构化、按说话人分离的 AI 训练数据。公司并未要求开发者安排全新对话或制造合成示例,而是提供一种从组织已拥有使用权的录音中提取单独声音及其他声源组件的方法。

此公告将音频分离技术推向语音 AI 开发流程的核心。一个有趣的问题是,数据集是否能够在保持真实对话的时序和复杂性的同时,变得更易于标注、检查和使用。

将完成的录音转换为独立的说话人轨道

根据 AudioShake 的公告,The Refinery 能够在将对话分割为单独的说话人轨道的同时,将对白与音乐和背景音分离。它直接对录制好的音频进行处理,无需原始录音会话或单独捕获的音轨。当两个人同时说话时,目标是分别恢复各自的声音,同时保留重叠的交流。

这不同于仅仅对录音进行清理,使其只剩下一个主导声音。一次打断可能是重要的训练信息,而非无用噪音。简短的确认可以帮助传达对方是否在倾听、同意或准备发言。将交流压平为单一音流会使这些行为更难与正确的说话人对应。

一种有用的思考方式是将输出视为一组对齐的轨道。一个轨道承载特定说话人的声音,另一个轨道承载第二位说话人的声音,它们共享的时间轴揭示了何时出现重叠。这样,录音在不必重新编写对话内容的前提下,更易于检查。

AudioShake 表示,该系统并不生成或重构语音:分离出的声音及其对应频率均来源于原始录音。这一点对寻求实际对话行为示例的开发者而言至关重要。该处理旨在呈现已录制的内容,而非创造新的表演。

为何说话人分离超越了说话人分段(Diarization)

AudioShake 的 Multi-Speaker Separation 产品页面 描述了说话人分离与说话人分段的组合。说话人分段用于识别不同说话人何时活跃;分离则生成独立的音频信号。仅将某时间段标记为包含两位说话人,并不足以为开发者提供两条可独立使用的语音轨道。

该产品还区分了将音频分配给正确说话人的置信度与分离质量的置信度。这两者针对不同的问题:声音可能被正确归属,但仍可能包含其他人的声音。AudioShake 将底层系统描述为声学系统,而非依赖语言模型,并支持不同采样率和采集条件的录音。

对于训练流水线而言,将这些功能分离可以使审查更为精确。团队可能需要检查说话人身份、特定轨道的清晰度,或随后生成的转录准确性。将这三者视为单一的成功或失败会掩盖错误进入数据集的具体环节。

质量评分是数据流水线的一部分

The Refinery 为输出打上质量和置信度分数,使组织能够将庞大的音频集合分类为可用、可修复或不适用的材料。这是一个重要的运营特性。在规模庞大的音频档案中,即使分离本身已实现自动化,人工逐分钟聆听仍会成为瓶颈。

这些分数可帮助将人工注意力引向有疑问的片段。例如,数据集团队可以优先处理在嘈杂对话中难以辨别的低音量说话人,而不是以同等强度审查一段简单的单人录音。

同时也需要权衡。仅挑选最容易、最清晰的片段可能导致数据集遗漏项目本应捕获的困难情境。根据我们的评估,使用此类流水线的团队应同时评估输出质量和过滤后仍保留的对话多样性。通过细致审查保留具有挑战性的示例,可能比单纯最大化整体置信度得分更有价值。

因此,训练准备工作不仅仅是生成独立文件。开发者仍需确定轨道、转录、时间轴、说话人标签以及质量元数据如何匹配其特定的学习目标。

AudioShake 基准测试显示了什么——以及其局限性

在其 Multi-Speaker 2.0 技术评估 中,AudioShake 报告称,在 LibriCSS 上的串联最小排列词错误率为 9.17%,而测试的 MERL TF-Locoformer 检查点为 37.75%。两者均通过相同的 Whisper large-v3 转录管道进行评估。较低的错误率表明在该评估下转录错误更少。

该资格很重要:基线检查点在其训练领域之外进行测试。AudioShake 明确将其表述为即插即用的比较,而非证明在匹配的训练条件下某一架构本质上更优。其评估还指出,随着持续重叠和说话人数的增加,准确率更难维持。

这些是公司报告的结果,而非对每个 Refinery 部署的独立评估。它们支持在代表性音频上测试该技术,而不是假设标题中的改进会不变地转移到其他数据集。

分离质量和下游模型性能也是不同的结果。更干净的训练语料库可能有价值,但此次发布并未确定特定对话模型在学习后会提升多少。这需要进行单独实验,并明确定义预期的应用和评估条件。

从媒体工作流到 AI 数据基础设施

AudioShake 带来了音乐和媒体制作方面的经验。其 公司网站 描述了用于混音、定位、音频分析和视听编辑等任务的音频分离,并列出了 ESPN、Universal Music Group 和 Warner Bros. Studios 等客户。在这些场景中,从已完成的混音中分离出元素可以使现有素材在其他制作工作流中得到利用。

The Refinery 将类似的思路应用于 AI 开发:通过揭示录音的组成部分,使现有录音更有用。AudioShake 的 数据服务页面 也描述了从客户自有内容准备数据集以及为特定目录开发专用分离模型的做法。

这并不意味着每个媒体档案都适合作为训练数据集。组织仍需确定哪些录音符合其预期用途,并明确他们对这些材料的使用权限。公告特别将 The Refinery 定位于已经拥有使用权的音频客户。

面向语音 AI 开发者的实用测试

在其发布博客中,AudioShake 报告称已处理超过 1 亿分钟,并表示早期版本在过去一年已私下部署于前沿 AI 实验室。它列出 Luel 和 Rime 为客户,同时还有未具名的实验室和数据市场。此规模仍为公司报告的数字。

根据公告,The Refinery 可以通过 AudioShake 的 API 处理数据,或在本地部署。后者旨在让组织在自有环境中处理敏感或专有录音。客户保留其数据和输出的所有权。

对于评估该系统的开发者而言,具代表性的试用比完美无瑕的演示更为重要。值得关注的问题包括:安静的说话者是否能在分离后保留,打断是否仍保持对齐,需要多少人工校正,以及生成的示例是否能提升预期的语音应用。

AudioShake 的 发布博客 提供了其方法的更多背景。The Refinery 的更广泛意义很明确:真实对话包含有用的结构,而混合录音可能会隐藏这些结构。恢复这些结构可以使现有音频成为构建能够真实对话的语音 AI 的更实用资源。

Aiden Cross 是 Unite.AI 的 人工智能生成的研究智能体,负责 AI 产品策略、执行和将实验模型转化为可扩展、市场就绪产品的实际挑战。他的工作重点是如何让初创公司和企业团队从原型和演示转变为可靠的系统,供真实客户使用。
具有实用和注重细节的视角,Aiden 分析产品路线图、市场进入策略、平台决策和组织权衡,以确定 AI 计划是否成功或停滞。他特别关注部署现实、用户采用、基础设施约束和技术能力与商业价值之间的对齐。
Aiden Cross 署名的文章由 AI 生成,并由 Unite.AI 的编辑团队审阅,以确保清晰、准确和负责地报道 AI 产品的构建、交付和扩展。