思想领袖
AI时代的监考:为何考试设计仍居首位

在需求增长和隐私法规收紧的背景下,为在线考试做好未来保障。
全球在线考试软件市场在2025年价值94亿美元,预计到2034年将达到287亿美元,随着培训机构、专业组织和教育机构日益将评估转移到线上。
在线考试的流行不难理解,因为教育机构正应对经费限制和校园空间不足,而雇主和专业组织则在寻找更灵活的评估候选人的方式。远程测试让个人能够在学习和认证、工作以及个人事务之间取得平衡,使评估比传统的现场形式更易获得。
然而,行业面临的最大挑战并非规模,而是古老的商品——信任。随着 AI 工具使作弊更难被发现,机构面临日益增长的压力,需要证明在线评估公平、安全且合规。
最近,特许公认会计师协会(Association of Chartered Certified Accountants)因在 AI 作弊担忧的背景下决定终止远程考试而成为新闻焦点,而Ofqual则报告称教师发现越来越难在评估作品中识别 AI。甚至普林斯顿大学(Princeton University),作为全球顶尖大学之一,已修改其拥有133年历史的荣誉守则,引入现场考试的监考。
面对这些压力,人们很容易认为增加监考是解决方案。然而,监控过度并不一定能提升标准或获得更准确的结果。在许多情况下,过度监控会影响可及性,削弱考生信任,并引发隐私担忧。
监考并非良好评估设计的捷径
监考是防止不端行为的有效工具,但它并非解决糟糕评估设计的单一方案。现场监考员无法同时监视所有考生。然而,在线监考也有其局限性,因为学生已被发现使用智能设备来规避在线监控手段。
当考试侧重于测试考生记忆,例如标准化的多项选择题考试时,作弊的动机会增加,因为可供选择的正确答案池有限。如果该考试在最终成绩中占有重要比重,这种动机会进一步上升。这类考试形式本质上更容易受到 AI 的攻击,AI 擅长检索和复现此类信息。
当考试旨在测试考生分析信息并将理论应用于不同情境的能力时,AI 所提供的即时优势会迅速减弱。这更贴合现代职业环境,员工很少需要完全凭记忆工作。
在实践中,这表现为围绕假设情境设定的情境题,要求考生阐述答案的理由。当与时间限制、浏览器锁定或复制粘贴限制相结合时,即使是精心构造的 AI 回答也难以有效使用。这类问题要求原创推理,而非可检索的事实。
通过在受控环境下开展开卷考试、案例研究及其他批判性思维任务,机构可以构建评估模型,使安全措施分布在评估过程的多个环节。这将使其能够降低对监控的依赖,因为诚信是内嵌在考试结构中的,而非通过监视强加的。
虽然基于记忆的测试仍然对评估考生的基础知识至关重要,但当它与其他应用型测试形式相结合时,机构能够更细致地了解考生的能力。
考试权重也可以重新构建以降低作弊风险。如果评分在各场考试之间更均衡,考生感受到的高分压力会大幅降低,从而自然减少作弊动机。这为在不依赖重度监控的情况下保障考试提供了另一种选择。
监考在所有考试中都是必不可少的,但绝不应成为唯一的诚信保障手段。与其专注于各种监控手段,不如在设计考试形式和题目时,使所有形式的作弊(不仅仅是 AI)在设计上更难实现。
合规为何至关重要
随着机构在在线考试中实施监考措施,他们还必须遵循隐私和数据保护法规,以确保监控手段公平且符合法律要求。
根据《通用数据保护条例》(GDPR),采集视频流、音频录音以及其他生物特征数据被视为高度敏感信息;因此,收集必须有正当理由,并且考生需要了解其数据的使用方式。
欧盟人工智能法案(EU AI Act)也对全自动考试监控设立了限制,强调高风险评估必须保有人类监督、可审计的输出,以及工作人员介入或覆盖自动决策的能力。
与此同时,机构应考虑存储大量监考数据的长期风险,因为在线考试引入的监考越多,随之需要管理的数据也越多。这构成了显著风险,鉴于针对英国教育部门的网络安全攻击数量庞大。
这就是为何“一刀切”的监考模式已不具法律可辩性。为避免全盘监控,机构应采用数据最小化的思路,并依据考试风险等级配置监考模式。
当审慎的考试设计得到适度监考的支持时,在线考试将更加安全。更重要的是,这向监管机构和考生展示了测试条件的公平合规,同时仍提供验证结果所需的审计追踪。
评估的未来
在线考试的快速增长为学习和职业发展带来了巨大机遇。然而,这也在考试安全的定义和管理方式上提出了根本性挑战。
能够蓬勃发展的培训机构、专业组织和教育机构将是那些将考试设计与监考视为互补,而非仅依赖监控的机构。诚信不是可以从外部监测的东西,必须从一开始就内嵌于考试之中。












