AI 基础

情感人工智能(情感计算)是什么?它为何重要?

mm
将 Unite.AI 添加到您在 Google 上的首选来源

情感人工智能,常称为情感计算,将计算应用于与情感相关的信号,如语言、声调、面部动作、姿势、生理或交互模式。系统可以对标签进行分类,估计诸如效价和唤醒度等维度,或对界面进行适配。

输出是一种推断——而非对内部情感状态的直接读取。表达因个人、文化、情境、健康和情形而异,同一可观测信号可能对应多种解释。高风险的使用需要充分的证据、同意以及法律审查。

关键要点

  • 精确定义可观测目标;情感、表情、情绪、压力和参与度并不等同。
  • 在目标人群和环境中进行验证,而不仅仅是经过挑选的基准。
  • 优先提供辅助和用户控制,而非隐藏监控或产生后果的自动判定。
  • 记录不确定性、数据权利、保留期限、子群体表现以及对决策提出异议的路径。
What Is Emotion AI (Affective Computing), and Why Does It Matter? workflow diagram
情感人工智能在不确定性下估计模式;它并未直接观察私人心理状态。

信号与模型目标

文本模型可以估计表达的情感;音频模型利用时序、音高和能量;视觉模型分析动作;生理系统可能使用心率或皮肤电导。多模态系统会组合这些信号,但传感器数量的增加并不必然产生更真实的标签。

诸如“沮丧”之类的标签取决于标注指令和情境。情感分析针对词语的范围比推断个人情绪状态更窄,两者都不应与临床评估混淆。

为何情境和不确定性占主导

人们会掩饰、夸大或以不同方式表达情感。残障、语言、光照、麦克风质量以及社会规范都可能改变可观测信号。实验室数据集可能无法代表呼叫中心、课堂、车辆或诊所的情境。

评估校准、弃权、各子群体错误、跨领域表现以及备选方案。混淆矩阵有助于展示哪些标签被混淆,但仍需定性审查以了解原因。

有用与风险并存的应用

用户可控的应用可以支持可及性、反思日志、适应性训练或安全警报。这类使用应明确测量内容,允许纠正,并避免夸大确定性。

就业、教育、保险、执法和健康决策的风险更高。欧盟《人工智能法案》禁止在工作场所和教育领域的某些情感识别使用,虽有特定例外,并根据风险对其他使用进行分类。要求因司法管辖区而异,并随时间变化。

负责任的部署

首先询问任务是否真的需要情感推断。采用数据最小化、明确目的、短期保留、安全措施、独立测试、用户通知以及人工审查。避免利用为其他目的收集的信号构建二次画像。

采用可解释人工智能实践时不要暗示显著性图证明情感。以通俗语言传达不确定性,并提供有意义的退出或对关键结果提出质疑的方式。

情感的表示方式

分类模型预测诸如喜悦、愤怒、恐惧、悲伤或中性等标签。维度模型估计效价、唤醒度和支配感等连续值。评估模型描述个人如何评估事件。这些表示是理论和测量选择,并非可互换的真实事实。

标注可能来源于经历事件的本人、观察者、临床医生或实验方案。自我报告受限于内省和记忆;观察者标签从行为推断状态;生理测量反映唤醒度及多种非情感过程。数据集应说明标签代表的视角。

时序建模很重要,因为情感随时间展开。帧级别的面部标签可能对瞬时动作过度反应,而语句级别的平均可能掩盖变化。窗口长度、传感器同步、缺失通道以及说话者基线都会影响结果。

按模态划分的建模流水线

视觉流水线检测并对齐人脸或身体,提取帧或关键点,然后对空间和时间特征进行分类。遮挡、摄像角度、压缩、肤色、眼镜、面部差异以及刻意表情都可能影响性能。面部动作单元比直接声明情感更直接描述动作,可能是更安全的目标。

音频流水线分离语音,归一化音量,并对谱、韵律和时序模式建模。音调升高可能表示兴奋、压力、提问或说话者习惯。文本流水线捕获表达的评估和上下文,但若未与音频结合则失去语调信息。多模态融合可以在特征层、决策层或跨注意力层进行。

个性化可能校准至个人基线,但需要更多数据并会生成敏感的长期画像。系统应尽可能采用局部或短期适配,并且必须避免在没有正当目的的情况下使用某人的数据进行无关推断。

评估、人因与防护措施

随机将同一视频的帧在训练和测试中拆分会导致信息泄漏。应根据预期声明保留人员、会话、设备、站点和时间段。报告宏观指标,以免常见类别掩盖稀有状态的失效,并为模糊输入提供弃权选项。

用户研究应衡量适配是否真的有帮助。基于错误推断改变语调的界面可能让人感到侵入或居高临下。让用户纠正系统、选择适配程度,并看到响应的功能原因,而不是被强加确定的情感标签。

高风险部署需要进行影响评估、法律审查、安全防护,并禁止二次使用。仅在必要时存储原始视频或生物特征,限制访问并明确删除规则。不要将情感分数作为欺骗、绩效、能力、意图或心理健康的唯一证据。

部署前评估情感AI使用案例

首先明确所声称的构念:面部动作、声调、自我报告感受、观察行为或临床状态并非可互换。识别将使用输出的决策以及是否有侵入性更低的信号可替代。一个根据明确的沮丧反馈调整游戏难度的系统,其证据和风险概况与通过摄像头推断员工诚实度的系统不同。

验证需要具备代表性的人群、文化、语言、设备、情境和录制条件,并使用与声明相匹配的真实标签。与简单基线进行比较,并报告不确定性、子群体错误、评审者间分歧以及实验室外的表现。不要将概率分数转化为对个人感受的分类性陈述。为用户提供纠正、退出选项,以及在可行时提供非生物特征的途径。

禁止仅基于推断情感作出具有后果的决定,尤其在就业、教育、保险、执法、医疗保健和服务获取方面。尽量减少原始音视频的保留,隔离生物特征标识,并控制二次使用。文档应阐明训练情境、预期用途、无效用途以及已知混杂因素,如残障、掩饰、压力、文化或药物。情感人工智能是一种测量声明,需要证据支撑,而非通往内部体验的魔法窗口。

实用实施清单

将概念转化为有界、可测试的工作流: 观察 → 预处理 → 推断 → 校准 → 辅助 → 监控。指定负责的所有者,记录数据及其依赖,建立简单基线,设定接受和停止标准,测试具代表性的失败,并在扩大范围前定义监控、回滚和审查。记录版本和假设,以便其他团队能够复现结果并了解变更。

在上线前,进行有文档记录的就绪评审,参与者包括构建、运营、保障以及受系统影响的人员。测试常规情形、边界条件、依赖失效和误用;保留证据和未解决的风险。明确谁可以批准发布、修改阈值、覆盖输出或停止运行。实地数据到来后重新审视决策,因为技术上成功的试点并不保证在更大规模上的可靠表现。

  • SIGNAL: 面部、声音、文本、身体或生理。
  • CONTEXT: 个人、文化、任务和环境。
  • AGENCY: 通知、控制、纠正和申诉。

常见问题

AI 能够准确地从面部读取情感吗?

它可以根据面部动作预测数据集标签,但这些动作并不能唯一决定内部情感。准确性高度取决于情境、人口、标签以及测量设计。

情感人工智能合法吗?

这取决于使用场景、数据、涉及人员以及司法管辖区。某些情境被禁止或属于高风险。组织需要最新的法律意见,而非通用的技术清单。

主要参考文献

Haziqa 是一名具有丰富经验的数据科学家,擅长为 AI 和 SaaS 公司撰写技术内容。