访谈
Gladia创始人兼CEO Jean-Louis Quéguiner – 采访系列

Jean-Louis Quéguiner 是Gladia的创始人和CEO。他之前曾担任欧洲领先的云服务提供商OVHcloud的数据、人工智能和量子计算集团副总裁。他拥有加拿大魁北克大学和巴黎艺术与工艺学院的符号人工智能硕士学位。在他的职业生涯中,他曾在金融数据分析、实时数字广告的机器学习应用以及语音人工智能API的开发等各个行业担任过重要职位。
Gladia 提供高级音频转录和实时人工智能解决方案,用于无缝集成到各个行业、语言和技术栈中的产品。通过优化最先进的自动语音识别(ASR)和生成人工智能模型,它确保了准确、无延迟的语音和语言处理。Gladia的平台还可以从电话和会议中实时提取见解和元数据,支持关键的企业用例,例如销售辅助和自动客户支持。
是什么激发了您解决语音转文本(STT)技术挑战的灵感?您在市场上看到哪些空白?
当我创立Gladia时,最初的目标很广泛——一家使复杂技术变得可及的AI公司。但是,当我们深入研究后,很明显语音技术是最破碎的,也是最关键的领域需要关注。
语音是我们日常生活的核心,我们的大部分沟通都是通过说话进行的。然而,开发人员用于处理语音数据的工具在速度、准确性和价格方面都是不充分的,尤其是在不同语言之间。
我想解决这个问题,解开语音技术的复杂性,并将其重新包装成简单、有效、强大和易于使用的东西。开发人员不应该担心AI模型的复杂性或语音识别的上下文长度的细微差别。我的目标是创建一个企业级的语音转文本API,能够无缝地工作,无论底层模型或技术如何——一个真正的即插即用解决方案。
在构建企业级转录解决方案时,您遇到了哪些独特的挑战?
在语音识别中,速度和准确性——该领域的两个关键性能指标——是逆向相关的。这意味着提高一个会损害另一个,至少在某种程度上。成本因素很大程度上取决于提供者在速度和质量之间的选择。
在构建Gladia时,我们的目标是找到这两个因素之间的完美平衡,同时确保技术仍然对初创企业和中小企业可用。在此过程中,我们还意识到基础ASR模型(如OpenAI的Whisper,我们曾广泛使用)是有偏见的,严重偏向英语,因为它们的训练数据,这使得许多语言代表性不足。
因此,除了解决速度-准确性权衡外,作为一个欧洲、多语言团队,对我们来说优化和微调我们的核心模型以构建一个真正的全球API以帮助企业跨语言运营也很重要。
Gladia如何在拥挤的AI转录市场中区别于其他公司?您的Whisper-Zero ASR有什么特别之处?
我们的新实时引擎(Gladia Real Time)实现了行业领先的300毫秒延迟。除了此功能外,它还能够从电话或会议中提取见解,使用所谓的“音频智能”附加功能或功能,例如命名实体识别(NER)或情感分析。
据我们所知,很少有竞争对手能够提供同时具有如此低延迟(不到1秒端到端)和准确性的转录和见解——并且能够在英语以外的语言中实现这一点。我们的语言支持目前已扩展到100多种语言。
我们还特别强调使产品真正与技术栈无关。我们的API与所有现有的技术栈和电信协议(包括SIP、VoIP、FreeSwitch和Asterisk)兼容。电信协议尤其复杂,需要集成,因此我们相信这一产品方面可以为市场带来巨大的价值。
AI模型中的“幻觉”是一个重大问题,尤其是在实时转录中。您能解释一下“幻觉”在语音转文本(STT)背景下的含义以及Gladia如何解决这个问题吗?
“幻觉”通常发生在模型缺乏知识或上下文时。虽然模型可以生成定制的输出,但它们只能引用其训练时存在的信息,这些信息可能已经过时。模型将通过用听起来合理但不正确的信息填充空白来创建连贯的响应。
虽然“幻觉”首先在大型语言模型(LLM)中被发现,但它们也会发生在语音识别模型中——例如Whisper ASR,它是该领域的领先模型,由OpenAI开发。Whisper的“幻觉”与LLM类似,由于其类似的架构,因此这是一个与生成模型相关的问题,这些模型可以根据上下文预测后续单词。在某种意义上,它们“发明”了输出。
这与更传统的基于声学的ASR架构形成对比,这些架构以更机械的方式将输入声音与输出匹配。
结果可能是,您会在转录中找到实际上没有说过的单词,这在医学等领域尤其成问题,因为这种错误可能会造成严重的后果。
有几种方法可以管理和检测“幻觉”。一种常见的方法是使用检索增强生成(RAG)系统,该系统将模型的生成能力与检索机制相结合,以交叉检查事实。另一种方法涉及使用“思维链”方法,模型被引导通过一系列预定义的步骤或检查点,以确保它保持在逻辑路径上。
检测“幻觉”的另一种策略涉及使用在训练期间评估模型输出真实性的系统。有专门的基准测试用于评估“幻觉”,这些测试涉及比较模型生成的不同候选响应,并确定哪一个最准确。
在构建Whisper-Zero(我们的专有ASR,几乎消除了所有“幻觉”)时,我们尝试了多种技术。它在异步转录中取得了极好的结果,我们目前正在为实时转录优化它,以实现相同的99.9%信息保真度。
STT技术必须处理各种复杂问题,例如口音、噪音和多语言对话。Gladia如何解决这些挑战以确保高准确性?
ASR中的语言检测是一项极其复杂的任务。每个发言者都有一个独特的语音签名,我们称之为特征。通过分析语音谱,机器学习算法可以执行分类,使用梅尔频率倒谱系数(MFCC)提取主要的频率特征。
MFCC是一种受人类听觉感知启发的方法。它是“心理声学”领域的一部分,专注于我们如何感知声音。它强调了较低的频率,并使用诸如归一化傅里叶分解等技术将音频转换为频率谱。
然而,这种方法有一定的局限性:它纯粹基于声学。如果您带着强烈的口音说英语,系统可能无法理解内容,而是根据您的韵律(节奏、重音、语调)进行判断。
这就是Gladia创新解决方案的用武之地。我们开发了一种混合方法,结合了心理声学特征和内容理解以实现动态语言检测。
我们的系统不仅仅是倾听您说话的方式,还要了解您在说什么。这一双重方法使得代码切换(code-switching)高效,并且不会让强烈的口音被误判或误解。
代码切换——这是我们的一个关键区别点——是在处理多语言对话时尤为重要的功能。说话者可能会在对话中间(甚至在句子中间)切换语言,模型能够准确地实时转录这一点至关重要。
Gladia API在处理如此多语言对的代码切换方面是独一无二的,并且即使在嘈杂的环境中,也能保持高准确率,这些环境通常会降低转录质量。
实时转录需要超低延迟。您的API如何在保持准确性的同时实现不到300毫秒的延迟?
保持延迟低于300毫秒同时保持高准确性,需要采取多方面的方法,结合硬件专业知识、算法优化和架构设计。
实时AI与传统计算不同——它与GPGPU的功率和效率密切相关。我已经在这个领域工作了近十年,曾领导OVHCloud(欧盟最大的云服务提供商)的AI部门,亲身体会到找到合适的平衡的重要性:需要多少硬件功率,多少成本,以及如何使算法与硬件无缝协同工作。
实时AI的性能来自于有效地将我们的算法与硬件的能力相匹配,确保每个操作最大化吞吐量同时最小化延迟。
但这不仅仅是AI和硬件。系统的架构也起着重要作用,尤其是网络,这可能会显著影响延迟。我们的CTO在Sigfox(IoT先驱)工作期间拥有低延迟网络设计的深厚专业知识,他优化了我们的网络设置,以削减宝贵的毫秒。
所以,这确实是所有这些因素的结合——智能的硬件选择、优化的算法和网络设计——使我们能够始终实现低于300毫秒的延迟,同时不损害准确性。
Gladia超出了转录的范畴,提供诸如说话人识别、情感分析和时间戳转录等功能。您看到客户使用这些工具开发了哪些创新应用?
ASR解锁了各个垂直领域的广泛应用,并且看到这么多真正开创性的公司在过去两年中出现,利用LLM和我们的API构建尖端、具有竞争力的产品,真是令人惊讶。以下是一些例子:
- 智能笔记:许多客户正在为需要快速捕获和组织工作会议、学生讲座或医疗咨询信息的专业人士构建工具。通过说话人识别,我们的API可以确定谁说了什么,使得跟踪对话和分配操作项变得容易。结合时间戳转录,用户可以直接跳转到录音中的特定时刻,节省时间并确保没有任何信息在转录中丢失。
- 销售赋能:在销售世界中,速度和准确的洞察力是至关重要的。团队正在使用我们的情感分析功能来实时了解客户在电话或演示过程中的反应。此外,时间戳转录帮助团队回顾对话的关键部分,以完善他们的推销或更有效地解决客户的疑虑。对于这个特定的用例,命名实体识别(NER)也很关键,因为它可以从销售电话中提取姓名、公司详细信息和其他信息,以自动填充CRM系统。
- 呼叫中心辅助:在合同中心领域的公司正在使用我们的API为代理提供实时辅助,并在呼叫过程中标记客户情绪。说话人识别确保所说的话被分配给正确的人,而时间戳转录使主管能够快速回顾关键时刻或合规性问题。这不仅提高了客户体验——通过更高的呼叫解决率和质量监控——还提高了代理的生产力和满意度。
您能否讨论自定义词汇和实体识别在提高企业用户转录可靠性方面的作用?
许多行业依赖于专业术语、品牌名称和独特的语言细微差别。自定义词汇集成允许STT解决方案适应这些特定需求,这对于捕捉语境细微差别和提供准确反映业务需求的输出至关重要。例如,它允许您在特定语言中创建一个特定领域的单词列表,例如品牌名称。
为什么它很有用:将转录适应特定的垂直行业允许您最小化错误,实现更好的用户体验。这个功能在医学或金融等领域尤为关键。
命名实体识别(NER)从非结构化音频数据中提取和识别关键信息,例如人员、组织、位置等名称。非结构化数据面临的常见挑战是,这些关键信息并不是轻易可得的——它们被埋藏在转录中。
为了解决这个问题,Gladia开发了一种结构化的关键数据提取(KDE)方法。通过利用其基于Whisper的架构的生成能力(类似于LLM),Gladia的KDE捕获上下文以识别和提取相关信息。
此过程可以通过自定义词汇和NER等功能进一步增强,允许企业快速高效地用关键数据填充CRM系统。
您认为实时转录如何改变诸如客户支持、销售和内容创作等行业?
实时转录正在以深刻的方式改变这些行业,推动了难以置信的生产力增益,并带来了切实的商业利益。
首先,实时转录是支持团队的游戏规则改变者。实时辅助是提高解决率的关键,带来更快的响应、更聪明的代理和更好的结果(以NSF、处理时间等为衡量标准)。随着ASR系统变得越来越擅长处理非英语语言和实时翻译,呼叫中心可以以较低的利润率实现真正的全球客户体验。
在销售中,速度和准确的洞察力是至关重要的。与呼叫代理发生的情况类似,实时转录使销售人员能够在正确的时间获得正确的洞察力,帮助他们专注于成交的最重要方面。
对于创作者来说,实时转录可能不那么相关,但在实时字幕和媒体活动中的翻译方面仍然充满潜力。我们目前的大多数媒体客户仍然更喜欢异步转录,因为在这些应用中,速度不那么关键,而准确性对于时间戳视频编辑和字幕生成等应用至关重要。
实时AI转录似乎是一个日益增长的趋势。在接下来的5-10年里,您认为这项技术会走向哪里?
我觉得我们现在所说的现象,即所谓的实时AI,会无处不在。从本质上讲,我们所指的是机器与人类的交互能力,就像人类与彼此交互一样。
如果你看任何一部设定在未来的好莱坞电影(比如《她》),你永远不会看到有人通过键盘与智能系统交互。这对我来说是最终的证明,在人类的集体想象中,语音永远是我们与周围世界交互的主要方式。
语音作为人类知识和历史的主要载体,比书写的历史更悠久。然后,书写接管了,因为它使我们能够比依靠社区的长辈来保存我们的故事和智慧更好地保存我们的知识。
能够理解语音、生成响应和存储交互的GenAI系统带来了这个领域的全新东西。它是最好的两全其美和人类的最佳体现。它给了我们语音交流的独特力量和能量,并带来了记忆的好处,之前只有书面媒体才能为我们提供。因此,我相信它会无处不在——这是我们的终极集体梦想。
感谢这次精彩的采访,希望了解更多的读者可以访问Gladia。












