AI 基础
什么是计算机视觉?
计算机视觉是构建从图像和视频中提取有用信息的系统的领域。视觉模型可能对整幅图像进行分类、定位对象、为每个像素标注、读取文本、估计姿态、跟踪运动,或将视觉内容与语言关联。
现代视觉系统并非仅仅复制人类感知的早期边缘检测过程。它们从数据中学习特定任务的表征,通常使用卷积神经网络、视觉转换器(Vision Transformers)或多模态基础模型。
要点概览
- 分类、检测、分割、光学字符识别(OCR)、跟踪和生成是不同的视觉任务。
- 卷积神经网络具备局部性和权重共享;视觉转换器在图像块之间使用注意力机制。
- 标签可以来源于人工、弱监督、合成数据或自监督目标。
- 仅有准确率不足: 稳健性、延迟、隐私、偏见和失败成本同样重要。

主要的计算机视觉任务
- 图像分类为图像分配一个或多个标签。参见图像分类的工作原理。
- 目标检测预测多个对象的类别和边界框。
- 语义分割按类别为每个像素标注,而实例分割则区分单独的对象。
- 光学字符识别(OCR)检测并转录文本。
- 姿态估计预测人体或物体的关键点。
- 跟踪在视频帧之间关联检测结果。
- 图像生成与编辑生成或转换视觉内容,通常使用扩散模型。
图像如何成为模型输入
数字图像本身就是数值数据: 一个包含空间维度和通道的像素值张量。预处理可能会对图像进行缩放、归一化、裁剪或增强。视频会增加时间维度,而医学和科学成像可能会加入深度、波长或其他模态。
传统计算机视觉使用手工设计的边缘、角点和纹理特征。现代深度模型通常与任务一起学习特征,尽管在数据有限、规则已被充分理解或计算资源必须最小化的情况下,传统方法仍然有用。
卷积神经网络与学习的局部特征
卷积神经网络在局部邻域上应用学习得到的卷积核。早期层可以响应局部模式,而后期块将其组合为任务相关的表征。池化或步幅操作降低空间分辨率,残差连接使深层网络更易于优化。
现代卷积神经网络分类器通常使用全局池化,而不是大量全连接层。检测器和分割网络会添加专门的头部或解码路径,以保留空间信息。
视觉转换器与基础模型
视觉转换器将图像划分为若干块,进行嵌入,并使用注意力来建模它们之间的关系。转换器在大规模数据集和预训练下能够有效扩展,而卷积神经网络在小规模时通常提供更强的内置假设和效率。
多模态模型将图像与文本对齐,使用户能够搜索、生成字幕、回答问题或使用语言引导分割。这些模型扩展了能力,但也继承了大规模网络数据的弱点,包括刻板印象、受版权保护的内容以及对人群和环境覆盖不均等问题。
标签、自监督与合成数据
标注边界框、掩码、关键点和字幕可能成本高昂。自监督学习从图像本身衍生目标,而弱监督使用噪声或间接标签。合成数据可以加入罕见场景,但仿真差距可能导致合成数据的性能无法迁移到真实世界。
必须对标注质量进行衡量。模糊的标签、不一致的边界以及缺失的对象会限制性能上限,并可能掩盖子群体的失败情况。
视觉系统如何评估
分类使用准确率、精确率、召回率、F1 值和校准等指标。检测通常使用交并比(IoU)和平均精度均值(mAP)。分割使用交并比或 Dice 类度量。跟踪则加入身份和轨迹指标。
指标必须与部署场景匹配。模型在精心挑选的基准上得分很高,却仍可能在雨天、低光、异常摄像角度、新设备或陌生人群中失效。评估应包括分布漂移、对抗条件和运行时延迟。
隐私、偏见与部署
人脸、车牌、住宅、医学扫描和工作场所视频可能泄露敏感信息。收集和保存应遵循明确的法律和伦理依据,并配备访问控制和数据最小化。面部分析和生物特征识别需要特别审查,因为错误和监控可能导致不平等的伤害。
边缘部署可以降低延迟和数据传输。边缘 AI、量化、剪枝和专用加速器可以使视觉系统在摄像头、车辆、机器人和移动设备上实用,但必须重新评估压缩对准确性和偏见的影响。
从像素到视觉任务
计算机视觉将图像或视频转化为任务输出,如分类、检测、分割、跟踪、姿态、深度、光流或文本识别。任务定义决定标注方式: 图像标签无法训练精确定位,边界框也无法完整描述分割掩码。相机几何、镜头、曝光、光照、运动、压缩和视角都会影响数据分布。在选择模型之前,需要定义运行环境和错误后果,因为基准图像集合可能并不代表实际部署的传感器或场景。
流水线会解码并校正媒体,进行缩放或切块,归一化数值,应用保持标签的增强,运行模型,并对 logits、框、掩码或轨迹进行后处理。目标检测器使用置信度阈值和抑制;跟踪器在时间上关联检测;分割可能需要形态学清理。保留坐标变换以使输出与原始图像对齐。按人员、相机、地点或采集会话划分数据,以避免几乎相同的帧同时出现在训练集和测试集中。
评估、偏见、隐私与运营
指标必须与任务和使用场景相匹配。分类需要类别特定的精确率和召回率;检测使用交并比和跨阈值的平均精度;分割使用 IoU 或 Dice;跟踪加入身份切换;延迟和漏报事件时长对视频至关重要。按光照、距离、设备、遮挡、肤色、年龄等相关条件报告结果。检查校准和高置信度错误。合成或增强数据可以填补空白,但需与真实部署数据对比,且不得泄露测试场景。
视觉系统可能会收集旁观者、地点、生物特征和敏感行为。应尽量减少捕获和保存,确保流媒体安全,限制二次使用,并在必要时提供通知或获取同意。测试对抗性贴片、重放、遮挡、相机故障和领域漂移。监控传感器健康、输入统计、输出率和确认结果;对关键决策保持人工审查。模糊或裁剪可以降低曝光,但也可能删除证据。高实验室得分并不能证明身份、情感或意图超出已验证任务的主张。
案例示例: 仓库通道的行人检测
摄像头监控受限的车辆通道,模型检测行人而非识别其身份。数据涵盖昼夜、天气、服装、遮挡、使用轮椅者、相机位置和空场景,并按录制会话划分。检测器在事件召回率、误报、定位、预警提前时间以及远距离性能上进行评估。安全工程定义了最大容忍延迟和独立的物理控制措施。
视觉警报可以减慢车辆速度,但紧急停车和障碍栏并不依赖学习模型。相机遮挡、画面冻结、网络丢失和模型超时会导致明确故障。原始视频的保存被最小化并记录访问。监控跟踪传感器健康、警报率、已审查事件以及按条件的险些失误。任何相机搬迁或布局更改都会触发重新验证,因为表面图像相似性并不保证相同的几何或风险。
实施证据与运营准备
生产决策需要的不仅是成功的演示。需明确预期用户、运行环境、输入、输出、依赖、负责人以及每个重要失效的后果。调优前建立可复现的基线和带版本的评估集。测试常规情况、边界条件、错误或缺失的输入、分布漂移、依赖中断、误用,以及最可能被忽视的群体或环境。测量任务质量时同时考虑校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全。记录每一次转换和阈值,以便独立审阅者能够复现结果并区分证据与吸引人的原型。
在发布前,指定发布、例外、变更、回滚和退役的责任人。采用分阶段推出,保留安全回退,并通过有意注入故障来验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康状况、人为覆盖以及确认的结果,同时不收集不必要的敏感数据。定义警报阈值和响应负责人,然后在部署后审查真实世界的证据,而不是假设离线性能会持续。每当数据源、用户、模型、供应商、政策、硬件或目标变化时都需重新评估。维护中的系统还需要有文档化的恢复、事件学习、删除和保留流程,以及明确的停用或替换时点。
常见问题
计算机视觉与图像识别是同一回事吗?
不是。图像识别通常指分类或识别。计算机视觉还包括定位、分割、测量、跟踪、重建、生成以及对视觉信息的推理。
视觉系统是否像人类一样观察?
不是。模型根据其架构和训练目标处理数值输入。它可能在狭窄的基准上超越人类,但在人类轻易处理的细微变化上却会失效。












