思想领袖

将信任构建到 AI 中是新的基准

mm
将 Unite.AI 添加到您在 Google 上的首选来源

AI 正在迅速扩展,并且像任何快速成熟的技术一样,它需要明确的界限——清晰、故意的,并且不仅仅是为了限制,还为了保护和赋予力量。这在 AI 几乎嵌入我们个人和职业生活的每个方面尤其重要。

作为 AI 领导者,我们站在一个关键时刻。 一方面,我们有学习和适应速度比以往任何技术都快的模型。另一方面,我们有责任确保它们以安全、完整和深层次的人类对齐方式运行。这不是一种奢侈——这是真正值得信赖的 AI 的基础。

信任最重要

过去几年中,语言模型、多模态推理和代理 AI 取得了显著进步。但是,每一步前进,风险都在增加。AI 正在影响商业决策,我们已经看到,即使是最小的失误也会带来严重的后果。

例如,法庭中的 AI,我们都听说过律师依赖于 AI 生成的论点,但发现这些模型编造了案例,导致律师受到纪律处分或甚至失去执业资格。事实上,研究表明,法律模型在至少六分之一的基准查询中会产生虚假信息。更令人担忧的是 Character.AI 的案例,该公司已经更新了其安全功能,一个聊天机器人被指与青少年自杀有关。这些例子凸显了未经检查的 AI 的现实风险和我们作为技术领导者所承担的责任,不仅要构建更智能的工具,还要以人性为核心,负责任地构建。

Character.AI 案例是一个令人清醒的提醒,为什么信任必须构建到对话式 AI 的基础中,在这种情况下,模型不仅仅是回应,还会参与、解释和适应实时交互。在语音驱动或高风险交互中,即使是一个单独的虚假答案或不合适的回应也会侵蚀信任或造成真正的伤害。防护栏——我们的技术、程序和道德保障——不是可选的;它们对于快速移动同时保护最重要的东西至关重要:人类安全、道德完整性和持久的信任。

安全、对齐的 AI 的演变

防护栏并不是新鲜事物。在传统软件中,我们一直有验证规则、基于角色的访问控制和合规性检查。但是,AI 引入了一种新的不可预测性:出现的行为、意外输出和不透明的推理。

现代 AI 安全性现在是多维的。一些核心概念包括:

  • 行为对齐,通过技术如强化学习从人类反馈(RLHF)和宪法 AI 实现,当您为模型提供一套指导“原则”时——有点像一个小型道德准则
  • 治理框架,将政策、道德和审查周期整合在一起
  • 实时工具,用于动态检测、过滤或更正响应

AI 防护栏的解剖结构

麦肯锡定义防护栏为旨在监控、评估和纠正 AI 生成内容的系统,以确保安全性、准确性和道德对齐。这些防护栏依赖于基于规则和 AI 驱动的组件的混合,例如检查器、更正器和协调代理,用于检测问题,如偏见、个人可识别信息(PII)或有害内容,并在交付前自动改进输出。

让我们来分析一下:

在提示到达模型之前,输入防护栏会评估意图、安全性和访问权限。这包括过滤和清理提示以拒绝任何不安全或无意义的内容,强制对敏感 API 或企业数据进行访问控制,并检测用户的意图是否与批准的使用案例匹配。

一旦模型生成响应,输出防护栏就会介入评估和改进它。它们过滤掉有毒语言、仇恨言论或虚假信息,实时抑制或重写不安全的回复,并使用偏见缓解或事实核查工具来减少虚假信息并将响应置于事实背景中。

行为防护栏管理模型随时间的行为,特别是在多步骤或上下文敏感的交互中。这些包括限制记忆以防止提示操纵,约束令牌流以避免注入攻击,并定义模型不允许执行的边界。

这些技术防护栏系统在整个 AI 堆栈的多个层次中发挥作用时效果最佳。

模块化方法确保保障措施是冗余和恢复力的,捕获不同点的故障并降低单点故障的风险。在模型级别,RLHF 和宪法 AI 等技术有助于塑造核心行为,将安全性直接嵌入模型的思考和响应方式中。中间件层包围模型以实时拦截输入和输出,过滤有毒语言,扫描敏感数据,并在必要时重新路由。在工作流程级别,防护栏协调逻辑和访问权限,跨多步骤过程或集成系统,确保 AI 遵守权限,遵循业务规则,并在复杂环境中表现可预测。

在更广泛的层面上,系统和治理防护栏在整个 AI 生命周期中提供监督。审计日志确保透明度和可追溯性,人工在环过程引入专家审查,访问控制确定谁可以修改或调用模型。一些组织还实施道德委员会,以指导负责任的 AI 开发,提供跨职能输入。

对话式 AI:防护栏真正受到考验的地方

对话式 AI 带来了独特的挑战:实时交互,无法预测的用户输入,以及保持有用性和安全性的高标准。在这些环境中,防护栏不仅仅是内容过滤器——它们有助于塑造语气,执行边界,并确定何时升级或转移敏感话题。这可能意味着将医疗问题转介给持牌专业人员,检测和缓解虐待性语言,或通过确保脚本保持在监管范围内来保持合规性。

在客户服务或现场运营等前线环境中,错误的余地更小。一个单独的虚假答案或不合适的回应可能会侵蚀信任或导致真正的后果。例如,一家大型航空公司因其 AI 聊天机器人向客户提供有关丧亲之痛折扣的错误信息而面临诉讼。法院最终判定该公司对聊天机器人的回应负责。这种情况下没有赢家。这就是为什么作为技术提供商,我们必须对我们交给客户的 AI 承担全部责任。

建立防护栏是每个人的工作

防护栏不应仅被视为技术壮举,也应被视为需要在整个开发周期中嵌入的思维方式。虽然自动化可以标记明显的问题,但判断、同理心和上下文仍需要人类监督。在高风险或模糊的情况下,人们对于使 AI 安全不仅是备用方案,也是系统的核心部分至关重要。

为了真正使防护栏运作,它们需要被编织到软件开发生命周期中,而不是在最后添加上。这样意味着在每个阶段和每个角色中都要嵌入责任。产品经理定义了 AI 应该和不应该做什么。设计师设定了用户期望并创建了优雅的恢复路径。工程师构建了回退、监控和审查钩子。QA 团队测试边缘情况并模拟滥用。法律和合规团队将政策转化为逻辑。支持团队担任人类安全网。经理必须优先考虑信任和安全,并在路线图上腾出空间,并奖励深思熟虑、负责任的开发。即使是最好的模型也会错过微妙的提示,这就是为什么训练有素的团队和明确的升级路径成为防御的最后一道防线,保持 AI 根植于人类价值观。

衡量信任:如何知道防护栏是否有效

您无法管理您无法衡量的东西。如果信任是目标,我们需要明确的成功定义,超越正常运行时间或延迟。用于评估防护栏的关键指标包括安全精度(有害输出被成功阻止的频率与假阳性)、干预率(人类介入的频率)和恢复性能(系统在故障后道歉、重定向或缓解的程度)。用户情绪、放弃率和重复混淆等信号可以提供对用户是否真正感到安全和被理解的洞察。并且,适应性——系统如何快速纳入反馈——是长期可靠性的强烈指标。

防护栏不应是静态的。它们应该根据实际使用、边缘情况和系统盲点进行演化。持续评估有助于揭示防护栏在哪里有效,在哪里过于严格或宽松,以及模型在测试时如何响应。没有对防护栏随时间性能的可见性,我们冒着将它们视为复选框而不是需要的动态系统的风险。

话虽如此,即使是最好的设计防护栏也面临着固有的权衡。过度阻塞可能会让用户感到沮丧;不足的阻塞可能会造成伤害。平衡安全性和有用性之间的平衡是一个持续的挑战。防护栏本身可能会引入新的漏洞——从提示注入到编码偏见。它们必须是可解释的、公平的和可调节的,否则它们将成为另一个不透明的层。

展望未来

随着 AI 变得更加对话式、集成到工作流程中,并能够独立处理任务,其响应需要可靠和负责任。在法律、航空、娱乐、客户服务和前线运营等领域,即使是单个 AI 生成的响应也可能影响决策或触发操作。防护栏有助于确保这些交互是安全的,并符合现实世界的期望。目标不是仅仅构建更智能的工具,而是构建人们可以信任的工具。在对话式 AI 中,信任不是奖励——它是基准。

阿萨夫·阿斯巴格(Assaf Asbag)是一位经验丰富的技术和数据科学专家,在人工智能行业拥有超过15年的经验,目前担任aiOla的首席技术和产品官(CTPO),aiOla是一家深度技术对话式人工智能实验室,他在那里推动人工智能创新和市场领导。