阿萨夫·阿斯巴格(Assaf Asbag)是一位经验丰富的技术和数据科学专家,在人工智能行业拥有超过15年的经验,目前担任aiOla的首席技术和产品官(CTPO),aiOla是一家深度技术对话式人工智能实验室,他在那里推动人工智能创新和市场领导。
我们被能够与我们交谈的机器所包围,我们也比以往任何时候都更频繁地与它们交谈。合成语音已经超越了新颖性,成为日常工具:播客旁白、虚拟教练应用程序和汽车导航系统。有些声音令人惊讶地自然和吸引人,而其他声音仍然让你感到不舒服。语音传达情感、建立信任,并让你感到被理解。随着我们与机器的对话变得常见,语音的质量将决定我们是否将它们视为有帮助的伙伴还是仅仅是另一个令人沮丧的技术。什么使得机器语音良好?构建有效的合成语音需要的不仅仅是清晰的发音。基础开始于清晰度。也就是说,语音必须在现实世界的条件下工作,穿透噪音,处理不同的口音,并保持可理解性,无论是否在导航交通或处理复杂的过程。这一背景驱动了语调选择,医疗助手需要冷静的专业性,健身应用程序需要充满活力的交付方式,支持机器人最好具有中立的一致性。高级系统通过调整来展示适应性,不仅仅是切换语言,还包括阅读对话线索,如紧迫性或沮丧,并在不中断流程的情况下做出适当的响应。同情心通过细微的元素,如自然的节奏、适当的强调和语音变化,表明真正的参与,而不是脚本朗读。当这些组件有效地协同工作时,合成语音从基本的输出机制转变为真正有用的通信工具,用户可以依赖它们,而不是绕过它们。核心管道:将文字转换为语音现代文本转语音系统通过多阶段处理管道运行,建立在几十年的语音研究和生产优化的基础上。将原始文本转换为自然听起来的音频需要每个阶段都具有复杂的工程。 该过程遵循明确的顺序:第1阶段 – 文本分析:合成的预处理在任何音频生成开始之前,系统必须解释和结构化输入文本。这个预处理阶段决定了合成的质量。在此处发生的错误可能会在整个管道中传播。关键过程包括:归一化:对模糊元素(如数字、缩写和符号)的上下文解释。机器学习模型或基于规则的系统根据周围上下文确定“3/4”是否代表分数或日期。语言分析:句法解析识别语法结构、单词边界和重音模式。消歧算法处理同形异义词,如区分“lead”(金属)和“lead”(动词),基于词性标记。音韵转录:图形到音韵(G2P)模型将文本转换为音韵表示,这是语音的声学构建块。这些模型包含上下文规则,可以是特定领域或口音适应的。语调预测:神经网络预测超音段特征,包括重音位置、音调轮廓和时序模式。此阶段决定了自然的节奏和语调,区分陈述和问题,并添加适当的强调。有效的预处理确保下游的合成模型具有结构化和无歧义的输入——产生清晰和自然听起来的语音的基础。第2阶段 – 声学建模:生成音频表示声学建模将语言特征转换为音频表示,通常是编码频率内容随时间变化的梅尔频谱。出现了不同的架构方法,每种都有不同的权衡:Tacotron 2(2017):开创了使用序列到序列架构和注意力机制的端到端神经合成。通过从数据中隐式学习语调,产生高质量、富有表现力的语音。然而,自回归生成创建了顺序依赖关系——慢速推理和潜在的注意力故障在长序列期间。FastSpeech 2(2021):通过完全并行生成解决Tacotron的局限性。用显式的持续时间预测替换注意力,实现了稳定和快速的推理。通过直接预测音调和能量轮廓来保持富有表现力的语音,针对需要低延迟合成的生产环境进行了优化。VITS(2021):端到端架构,结合变分自编码器、生成对抗网络和归一化流。直接生成波形,无需预对齐的训练数据。模拟了文本和语音之间的一对多映射,实现了多样化的语调实现。计算密集型,但富有表现力。F5-TTS(2024):基于扩散的模型,使用流匹配目标和语音填充技术。消除了传统的组件,如文本编码器和持续时间预测器。展示了强大的零样本能力,包括语音克隆和多语言合成。在10万+小时的语音数据上进行训练,以实现强大的泛化。每个架构输出梅尔频谱——时间频率表示,捕捉目标语音的声学特征,然后进行最终的波形生成。第3阶段 – 声码:波形生成最后阶段通过神经声码将梅尔频谱转换为音频波形。这个过程决定了系统的最终声学质量和计算效率。关键的声码架构包括:WaveNet(2016):第一个通过自回归采样实现接近人类音质的神经声码器。生成高保真输出,但需要顺序处理——一次一个样本,使实时合成在计算上不可行。HiFi-GAN(2020):针对实时合成优化的生成对抗网络。使用多尺度判别器在不同时间分辨率下保持质量。平衡保真度与效率,使其适合生产部署。Parallel WaveGAN(2020):WaveNet架构原理的并行化变体,结合非自回归生成。紧凑的模型设计使其能够在资源受限的设备上部署,同时保持合理的质量。现代TTS系统采用不同的集成策略。端到端模型,如VITS和F5-TTS,直接将声码集成到其架构中。模块化系统,如Orpheus,生成中间频谱,并依赖单独的声码器进行最终音频合成。这种分离使得声学建模和波形生成组件能够独立优化。管道集成和演化完整的TTS管道,包括文本预处理、声学建模和声码,代表了语言处理、信号处理和机器学习的汇聚。早期系统产生了机械、机器人般的输出。当前的架构生成具有自然语调、情感表达和特定说话者特征的语音。系统架构在端到端模型(联合优化所有组件)和模块化设计(允许独立组件优化)之间有所不同。当前挑战尽管取得了显著的进步,但仍然存在几个技术挑战:情感细微差别:当前模型处理基本的情感状态,但难以处理微妙的表达,如讽刺、不确定或对话的潜台词。长篇一致性:模型的性能通常会随着序列的延长而恶化,失去语调的一致性和表现力。这限制了在教育、有声书和延长对话代理中的应用。多语言质量:合成质量在低资源语言和区域口音中显著下降,造成了不同语言社区之间的可及性障碍。计算效率:边缘部署需要保持质量的同时在严格的延迟和内存约束下运行——对于离线或资源受限的环境至关重要。身份验证和安全性:随着合成语音质量的提高,强大的检测机制和音频水印成为必要,以防止滥用并维持真实通信的信任。伦理和责任:人类的风险随着该技术的快速发展,我们还需要考虑与日益逼真的合成语音相关的伦理影响。语音传递身份、情感和社会线索,使其独特地强大和独特地脆弱。技术设计必须在这里遇到人类的责任。同意和所有权仍然是基本问题。它到底是谁的声音?例如,看看斯嘉丽·约翰逊和OpenAI之间的案例——无论是从演员、志愿者还是公共录音中获取的,未经同意克隆声音即使在法律上是合理的,也会跨越伦理界限。透明度必须超越细则,扩展到有意义的披露和对声音使用的持续控制。深度伪造和操纵带来了即刻的风险,因为真实的声音可以说服、模仿或欺骗,通过假的紧急呼叫、伪造的高管命令或欺诈性的客户服务互动。可检测的水印、使用控制和验证系统变得必不可少,而不是可选功能。在其核心,合成语音的道德开发需要设计能够体现关怀和能力的系统——不仅考虑它们听起来如何,还要考虑它们服务于谁以及如何在现实世界中部署。语音将成为下一个接口:展望未来到目前为止所涵盖的所有内容,清晰度、表达力、多语言支持和边缘部署的改进,都指向着一个更大的转变:语音成为我们与技术交互的主要方式。在未来,与机器交谈将成为默认的接口。语音系统将根据上下文进行调整,例如在紧急情况下更加冷静,在适当的情况下更加随意,并将实时学习识别沮丧或困惑等事物。它们将在语言之间保持相同的语音身份,并在本地设备上安全运行,使交互感觉更加个人化和私密。重要的是,语音将通过动态语音塑造、压缩速率和反映情感和语调(而不仅仅是文本)的视觉提示来扩展听力障碍人群的可及性。这些只是即将到来的突破。最后的思考:连接,而不仅仅是说话我们正在进入一个时代,机器不仅处理语言,还参与其中。语音正在成为指导、协作和关怀的媒介,但随着这种转变而来的也是责任。信任不是你可以切换的功能;它是通过清晰度、一致性和透明度建立起来的。无论是支持危机中的护士还是引导技术人员完成关键任务,合成语音都步入了重要时刻。语音的未来不是关于听起来像人类。它是关于赢得人类的信任——一次一个词,一次一个交互,一次一个决定。
AI 正在迅速扩展,并且像任何快速成熟的技术一样,它需要明确的界限——清晰、故意的,并且不仅仅是为了限制,还为了保护和赋予力量。这在 AI 几乎嵌入我们个人和职业生活的每个方面尤其重要。作为 AI 领导者,我们站在一个关键时刻。 一方面,我们有学习和适应速度比以往任何技术都快的模型。另一方面,我们有责任确保它们以安全、完整和深层次的人类对齐方式运行。这不是一种奢侈——这是真正值得信赖的 AI 的基础。信任最重要过去几年中,语言模型、多模态推理和代理 AI 取得了显著进步。但是,每一步前进,风险都在增加。AI 正在影响商业决策,我们已经看到,即使是最小的失误也会带来严重的后果。例如,法庭中的 AI,我们都听说过律师依赖于 AI 生成的论点,但发现这些模型编造了案例,导致律师受到纪律处分或甚至失去执业资格。事实上,研究表明,法律模型在至少六分之一的基准查询中会产生虚假信息。更令人担忧的是 Character.AI 的案例,该公司已经更新了其安全功能,一个聊天机器人被指与青少年自杀有关。这些例子凸显了未经检查的 AI 的现实风险和我们作为技术领导者所承担的责任,不仅要构建更智能的工具,还要以人性为核心,负责任地构建。Character.AI 案例是一个令人清醒的提醒,为什么信任必须构建到对话式 AI 的基础中,在这种情况下,模型不仅仅是回应,还会参与、解释和适应实时交互。在语音驱动或高风险交互中,即使是一个单独的虚假答案或不合适的回应也会侵蚀信任或造成真正的伤害。防护栏——我们的技术、程序和道德保障——不是可选的;它们对于快速移动同时保护最重要的东西至关重要:人类安全、道德完整性和持久的信任。安全、对齐的 AI 的演变防护栏并不是新鲜事物。在传统软件中,我们一直有验证规则、基于角色的访问控制和合规性检查。但是,AI 引入了一种新的不可预测性:出现的行为、意外输出和不透明的推理。现代 AI...
对话式 AI,使机器能够模拟人类对话,已成为今日市场上最受追捧的 AI 应用之一。IDC 预测,对话式 AI 软件服务市场将在 2024-2028 年继续保持强劲的增长势头,到 2028 年将达到 319 亿美元的收入。然而,随着对话式 AI 的热度不断增长,人们不禁会问:谁真正需要它,谁正在有效地使用它,谁又有可能落后?超越聊天机器人:什么是对话式 AI(以及不是什么)对话式 AI 通常被简化为聊天机器人和语音助手,但这只是冰山一角。虽然聊天机器人通常遵循预设的脚本和决策树,但对话式 AI 使用 自然语言理解 (NLU) 和机器学习来解释意图、上下文,甚至语气。这使得它能够超越简单的问答,处理更复杂、动态的交互,这些交互会随着时间的推移而演变。换句话说,聊天机器人可能会回答一个问题,但对话式 AI 可以进行对话,适应用户,并从每次交互中学习。 对话式...
尽管今天的自动语音识别(ASR)系统非常强大,但该领域远未被完全解决。研究人员和从业者正在努力解决一系列挑战,这些挑战将推动ASR的发展。从提高实时能力到探索将ASR与其他模式相结合的混合方法,ASR的下一波创新即将成为变革性的,就像之前的突破一样。推动研究的关键挑战 低资源语言虽然像Meta的MMS和OpenAI的Whisper这样的模型在多语言ASR方面取得了进展,但世界上绝大多数语言,尤其是代表性不强的方言,仍然没有得到很好的服务。为这些语言构建ASR系统很困难,主要是因为: 缺乏标记数据:许多语言缺乏足够规模的音频数据集。 语音复杂性:一些语言是声调语言或依赖于细微的语调线索,使得它们更难以使用标准的ASR方法进行建模。 现实世界中的嘈杂环境即使是最先进的ASR系统也可能在嘈杂或重叠的语音场景中挣扎,例如呼叫中心、现场活动或群体对话。解决诸如说话人识别(谁说了什么)和抗噪声转录等挑战仍然是一个高优先级的任务。 跨领域的一般化当前的ASR系统通常需要针对特定领域的任务(例如医疗保健、法律、教育)进行微调。实现一般化,即单个ASR系统可以在多个用例中无需领域特定调整即可良好运行,是一个主要目标。 延迟与准确性虽然实时ASR已经成为现实,但通常存在延迟和准确性之间的权衡。实现低延迟和近乎完美的转录,尤其是在资源受限的设备(如智能手机)中,仍然是一个技术障碍。 新兴方法:地平线上有什么?为了解决这些挑战,研究人员正在尝试新的架构、跨模式集成和混合方法,将ASR推向传统边界之外。以下是一些最令人兴奋的方向: 端到端ASR + TTS系统研究人员正在探索统一模型,可以无缝地转录和合成语音。这些系统使用语音和文本的共享表示,使它们能够: 在单个训练管道中学习双向映射(语音到文本和文本到语音)。 通过利用语音合成反馈环路来提高转录质量。例如,Meta的Spirit LM是朝这个方向迈出的一步,将ASR和TTS合并为一个框架,以保留跨模式的表达和情感。这一方法可以通过使系统更加自然、动态和富有表现力来革新对话式AI。 ASR编码器 + 语言模型解码器一个有前途的新趋势是将ASR编码器与预训练的语言模型解码器(如GPT)连接起来。在这种架构中: ASR编码器将原始音频处理为丰富的潜在表示。 语言模型解码器使用这些表示来生成文本,利用上下文理解和世界知识。为了使这种连接起作用,研究人员正在使用适配器——轻量级模块,它们将编码器的音频嵌入与解码器的基于文本的嵌入对齐。这一方法使得: 通过结合语言上下文来更好地处理模糊短语。 提高对嘈杂环境中的错误的鲁棒性。 与下游任务(如摘要、翻译或问答)无缝集成。 自监督 + 多模式学习自监督学习(SSL)已经通过模型如Wav2Vec 2.0和HuBERT改变了ASR。下一个前沿是将音频、文本和视觉数据结合到多模式模型中。...