사상 리더
AI 시대의 감독, 시험 설계가 여전히 최우선인 이유

수요 증가와 개인정보 보호법 강화 속에서 온라인 시험을 미래에 대비시키기.
글로벌 온라인 시험 소프트웨어 시장은 2025년 94억 달러에서 2034년 287억 달러까지 성장할 것으로 예상됩니다, 교육 제공자, 전문 기관 및 교육 기관이 평가를 온라인으로 전환하고 있기 때문입니다.
온라인 시험의 인기가 높은 이유는 교육 기관이 자금 제약과 제한된 캠퍼스 공간을 관리하고, 고용주와 전문 기관은 후보자를 평가할 보다 유연한 방법을 찾고 있기 때문입니다. 원격 시험은 개인이 학습과 인증을 업무 및 개인 일정과 조화시킬 수 있게 하여 전통적인 대면 형식보다 평가 접근성을 높입니다.
하지만 업계의 가장 큰 과제는 규모가 아니라 오래된 문제인 신뢰입니다. AI 도구가 부정 행위를 탐지하기 어렵게 만들면서, 기관들은 온라인 평가가 공정하고 안전하며 규정을 준수한다는 것을 증명해야 하는 압박이 커지고 있습니다.
최근, Association of Chartered Certified Accountants는 AI 부정 행위 우려 속에서 원격 시험을 종료하기로 한 결정을 발표하며 화제를 모았고, Ofqual은 교사들이 평가 작업에서 AI를 점점 더 식별하기 어렵다고 보고했습니다. 세계 최고의 대학 중 하나인 Princeton University는 133년 된 명예 규정을 수정하여 대면 시험에 감독을 도입했습니다.
이러한 압박으로 인해 더 많은 감독이 해결책이라고 생각하기 쉽습니다. 그러나 어느 정도 수준을 넘어서면 더 많은 감시가 반드시 더 나은 기준이나 더 정확한 결과를 보장하지는 않습니다. 과도한 모니터링은 접근성을 해치고, 후보자의 신뢰를 감소시키며, 개인정보 보호 문제를 야기할 수 있습니다.
감독은 좋은 평가 설계를 위한 지름길이 아니다
감독은 부정 행위를 방지하는 효과적인 도구이지만, 부실한 평가 설계에 대한 단독 해결책은 아닙니다. 대면 감독관은 모든 수험생을 동시에 감시할 수 없습니다. 그러나 온라인 감독에도 한계가 있는데, 학생들이 온라인 모니터링을 회피하기 위해 스마트 기기를 사용하는 사례가 알려져 있습니다.
시험이 수험생의 기억력을 평가하는 데 초점을 맞춘 경우, 예를 들어 표준화된 객관식 시험처럼 정답 풀이가 제한되어 있기 때문에 부정 행위 유인이 증가합니다. 해당 시험이 최종 성적에 큰 비중을 차지한다면 그 유인은 더욱 커집니다. 이러한 시험 형식은 정보를 검색하고 재현하는 데 뛰어난 AI에 본질적으로 더 취약합니다.
시험이 수험생의 정보 분석 능력과 이론을 다양한 상황에 적용하는 능력을 평가하도록 설계되면, AI가 제공하는 즉각적인 이점은 빠르게 감소합니다. 이는 직원들이 거의 기억에만 의존해 업무를 수행하지 않는 현대 직업 환경을 더 잘 반영합니다.
실제로는 가상의 시나리오를 기반으로 후보자에게 답변을 정당화하도록 요구하는 상황형 질문 형태를 띱니다. 시간 제한, 브라우저 잠금 또는 복사-붙여넣기 제한과 결합될 경우, 잘 구성된 AI 답변조차도 실용적으로 적용하기 어렵습니다. 이러한 질문은 재현 가능한 사실이 아니라 독창적인 사고를 요구합니다.
통제된 환경에서 오픈북 시험, 사례 연구 및 기타 비판적 사고 과제를 제공함으로써, 기관은 보안 조치를 평가 과정의 여러 단계에 분산시킨 평가 모델을 개발할 수 있습니다. 이렇게 하면 감시에 의존하는 대신 시험 구조 자체에 무결성을 내재시켜 모니터링 의존도를 낮출 수 있습니다.
기억 기반 테스트는 수험생의 기본 지식을 평가하는 데 여전히 중요하지만, 이를 다른 적용형 테스트 형식과 결합하면 수험생의 역량을 훨씬 더 상세히 파악할 수 있습니다.
시험 비중을 재구성하여 부정 행위를 완화할 수도 있습니다. 채점이 여러 시험에 고르게 분산되면 수험생은 높은 점수를 얻어야 한다는 압박감이 크게 줄어들어 부정 행위 유인이 자연스럽게 감소합니다. 이는 과도한 감시에 의존하지 않고 시험을 보호하는 또 다른 대안이 됩니다.
감독은 모든 시험에서 필수적이지만, 무결성을 유지하기 위한 유일한 수단이 되어서는 안 됩니다. 수험생을 감시하는 다양한 방법에 집중하기보다, 시험 형식과 문항을 설계하여 AI뿐만 아니라 모든 형태의 부정 행위를 설계 단계에서 어렵게 만들어야 합니다.
왜 준수가 가장 중요한가
기관이 온라인 시험에 감독 조치를 도입함에 따라, 감시 방법이 공정하고 법적으로 준수되도록 개인정보 보호 및 데이터 보호 법규를 준수해야 합니다.
GDPR에 따르면 비디오 피드, 오디오 녹음 및 기타 생체 데이터를 수집하는 것은 매우 민감한 정보로 간주되므로, 수집은 정당화되어야 하며 수험생은 자신의 데이터가 어떻게 사용되는지 알아야 합니다.
EU AI Act도 완전 자동화된 시험 모니터링에 제한을 도입했으며, 고위험 평가에서는 인간의 감독, 감사 가능한 결과 및 직원이 자동 결정을 개입하거나 무시할 수 있는 능력을 유지해야 함을 강조합니다.
동시에, 기관은 방대한 감독 데이터를 저장하는 장기적 위험을 고려해야 합니다. 온라인 시험에 감독이 많이 도입될수록 시간이 지나면서 관리해야 할 데이터가 늘어나기 때문입니다. 이는 영국 교육 부문을 대상으로 하는 사이버 보안 공격이 많이 발생하고 있다는 점을 고려하면 상당한 위험을 의미합니다.
이러한 이유로 일괄적인 감독 모델은 더 이상 법적으로 정당화될 수 없습니다. 무차별 감시를 피하기 위해 기관은 데이터 최소화 방식을 채택하고 시험의 위험 수준에 따라 감독 모델을 구성해야 합니다.
신중하게 설계된 시험이 적절한 감독과 결합될 때 온라인 시험은 더욱 안전해집니다. 더 중요한 것은, 이는 규제 기관과 수험생에게 시험 환경이 공정하고 규정을 준수함을 보여주며, 결과를 검증하기 위한 감사 추적도 제공한다는 점입니다.
평가의 미래
온라인 시험이 성장하는 속도는 학습 및 전문성 개발에 큰 기회를 제공하지만, 동시에 시험 보안이 어떻게 정의되고 관리되는지에 대한 근본적인 과제를 제기합니다.
성공할 교육 제공자, 전문 기관 및 교육 기관은 시험 설계와 감독을 상호 보완적으로 다루며, 단순히 감시에만 의존하지 않는 조직입니다. 무결성은 외부에서 감시할 수 있는 것이 아니라 처음부터 내재되어야 합니다.












