思想领袖

AI仍然需要教练,人工监督需要手册

mm
将 Unite.AI 添加到您在 Google 上的首选来源

AI无处不在,职业足球也不例外。

NFL推出了Digital Athlete,它利用数据和AI帮助球队识别球员可能面临更高受伤风险的情形。它将训练、练习和比赛中的视频与数据以及数百万次模拟相结合,为全部32支球队提供全联盟趋势信息。教练和训练人员随后使用这些信息制定个性化的防伤、训练和恢复方案。

虽然技术可以读取场上信息,但教练仍然负责做出决策。随着组织在包括合规和职场调查在内的业务流程中扩大AI的使用,自动化的潜力似乎无穷无尽。但AI应该执行哪些任务、在何种条件下以及需要何种人工监督?

这正是组织手册可以定调的地方:为教练提供利用AI工具的手段,同时在关键环节保持人工监督。

为AI设定位置,而非整个场域

调查涉及不同层级的风险。AI可以帮助整理来自初始报告的信息:

  • 识别缺失的细节
  • 将信息汇总成最终报告
  • 构建时间线
  • 呈现调查员可能想进一步审查的模式

这些用例可以减少人工筛选,腾出时间专注于需要人工判断的工作。

请注意,AI可以对指控进行摘要,但无法判断其可信度。AI可以识别不一致之处,但无法确定其原因。这正是组织仅仅使用AI而缺乏防护措施时可能陷入困境的地方。

为了保持监督,AI需要一个明确的角色。组织应当决定:

  • 系统应执行的任务
  • 它可以访问的信息
  • 它被允许执行的范围界限
  • 需要人员介入的情形

National Institute of Standards and Technology’s AI Risk Management Framework提供了一个有用的基准。NIST的路线图将AI RMF Profiles描述为展示该框架如何应用于特定行业、技术、情境或其他环境的一种方式。换言之,当组织将宽泛的原则转化为具体使用案例的现实时,负责任的AI治理就更具可操作性。

AI手册可以在运营层面实现类似的功能。它对角色、情境和行动进行明确界定。

人工监督是系统设计问题

“human in the loop”(人类在回路中)这一说法已在负责任AI的讨论中变得司空见惯。但在工作流的某处有人参与,并不自动意味着AI系统得到良好治理。

NIST已确定 human-AI teaming是AI风险管理研究与指导的重要领域。它强调的议题包括人们如何解读AI生成的输出,以及人在真实世界环境中如何监督AI系统的运行。

人工监督不应被视为一种临时变通,直至AI足够成熟以独立运行。在许多高风险环境中,它是长期负责任使用AI所必需的架构组成部分。

一项 peer-reviewed examination of human oversight in AI governance指出,期望人类监督者提升准确性和安全性,以维护人类价值并建立信任。然而,人类并非总是可靠的监督者。有效的监督取决于能力、激励以及监督角色的设计。

对于调查员而言,仅要求其批准AI生成的建议是不够的,若他们缺乏必要的信息或权力来质疑该建议。手册必须不仅定义这涉及人类,而且该人在何时以及如何进行干预。

交接与模型同等重要

还有另一个挑战:即使人类拥有最终权威,AI呈现信息的方式也可能影响随后的决策。

2025年的 preprint study from researchers at the University of California, Santa Barbara阐明了界面设计的重要性。在一项涉及108名参与者的医疗决策情境受控实验中,研究人员测试了六种AI决策支持形式。他们发现,包括AI置信度信息、文字解释和性能可视化在内的机制提升了人机决策的准确性。

该研究还强调了自动化偏差的风险:人们可能过度依赖AI建议,即使这些建议是错误的。

该实验展示了机器与人类之间的交接为何需要有意的设计和测试。

当我们进一步推断并引入调查的概念时,会出现若干问题:

  • 调查员是否仅看到AI生成的结论,还是能够审查其背后的信息?
  • 系统能否传达不确定性?
  • 信息缺失时是否清晰可见?
  • 调查员能否拒绝输出并记录原因?

这些既是治理问题,也是技术问题。

AI手册应回答的五个问题

实用的AI手册应将“负责任的AI”和“人工监督”等抽象原则转化为具体的操作规则。

  1. AI被允许做什么? 组织应授权具体任务,而不是在整个工作流中授予广泛使用AI的权限。
  2. 它可以使用哪些信息? 对于调查和举报,组织需要对AI系统可获取的信息以及这些信息的处理方式设定明确界限。
  3. 人们将如何评估其输出? 人工审阅者需要足够的上下文,以了解系统产出、相关限制以及质疑结果所需的信息。
  4. 何时必须有人介入? 手册应设定升级触发点,而不是依赖个别员工自行判断AI何时超出界限。
  5. AI的权限何时终止? 某些决策应由人工判断,负责这些决策的人需要拥有真正的权力来忽视、覆盖或停止该技术。

这些理念体现在全球最重要的AI监管文件之一。 Article 14 of the EU AI Act规定了针对属于该法案高风险类别的AI系统的人工监督要求。它指出,监督措施应与系统的风险、自治程度和使用情境相匹配。它还要求监督者能够了解相关的能力和局限性,正确解读输出,保持对自动化偏差的警觉,能够忽视或覆盖输出,并在必要时介入或停止系统。
这并不意味着调查中使用的每个AI工具都会自动被视为高风险系统。该框架阐明了AI治理的重要原则。人工监督必须为人类提供有意义的能力,而不仅仅是工作流中的一个环节.

AI并不取代教练,它改变了教练的视野。

NFL的Digital Athlete之所以引人注目,并非因为它表明AI可以取代教练,而是因为它展示了先进技术如何扩展经验丰富的专业人士可获取的信息。

AI可以帮助人们处理信息,突出值得关注的内容,并在可重复任务中实现更高的一致性。然而,调查中最关键的时刻往往需要其他要素:情境、怀疑精神、解读以及问责。

因此,最有能力从AI中受益的组织会提出超出技术自动化范围的要求。他们会明确AI应做什么、不应做什么,以及人类与AI如何协同工作。

WhistleBlower Security Inc. (WBS) 的创始人,以及 Case IQ 的执行副总裁(负责思想领袖与战略)