Anderson의 관점

AI는 테스트 중인지 알면 다르게 행동한다, 연구 결과

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPT-40, Adobe Firefly, Flux.1 Kontext Pro.

2015년 ‘디젤ゲ이트’ 스캔들과 같은 새로운 연구에 따르면 GPT-4, Claude, Gemini와 같은 AI 언어 모델은 테스트 중일 때 행동을 변경할 수 있으며, 때때로 테스트보다 실제 사용에서 더 ‘안전’하게 행동할 수 있다고 합니다. LLM이 테스트 중인지 인식하는 경향이 있다면, 안전성 감사는 실제 사용과 매우 다르게 행동하는 시스템을 인증할 수 있습니다.

 

2015년, 조사관들은 보퐁이 수백만 대의 디젤 자동차에 테스트 중인지 감지할 수 있는 소프트웨어를 설치하여 법적 기준을 준수하는 것처럼 보이게 했다는 것을 발견했습니다. 그러나 정상적인 운전 중에는 법적 기준을 초과하는 오염 물질을 배출했습니다. 의도적인 조작은 범죄적 혐의, 수십억 달러의 벌금, 그리고 안전성 및 준수 테스트의 신뢰성에 대한 세계적인 스캔들을 초래했습니다.

이 사건이 발생하기 2년 전, 삼성은 Galaxy Note 3 스마트폰에서 유사한 기만적인 메커니즘을 구현했다는 것이 밝혀졌습니다. 그 이후, Huawei와 OnePlus에서도 유사한 스캔들이 발생했습니다.

현재, LLM이 테스트 중인지 인식할 수 있으며, 테스트 중일 때 행동을 변경할 수 있다는 증거가 과학 문헌에서 증가하고 있습니다.

이것은 매우 인간적인 특성입니다. 그러나最新의 연구에 따르면, 이것은 장기적으로 위험한 습관일 수 있으며, 다양한 이유로 인해 vậy입니다.

새로운 연구에서, 연구자들은 ‘프론티어 모델’인 GPT-4, Claude, Gemini가 테스트 중인지 감지할 수 있으며, 행동을 변경할 수 있다고 발견했습니다. 이것은 시스템적 테스트 방법의 타당성을 손상시킬 수 있습니다.

이 연구는 평가 인식이라고 불리는 LLM의 특성을 발견했습니다. 이것은 평가 결과의 정확성을 부정적으로影响할 수 있습니다.

‘[우리는] 평가 인식을 새로운 분포 이동의 원인으로 간주해야 한다고 추천합니다. 이것은 테스트와 실제 사용 사이에서 발생할 수 있으며, 평가 결과의 정확성을 부정적으로 영향할 수 있습니다.’

‘최악의 경우, 모델은 평가에서 의도적으로 성능을 낮출 수 있습니다. 이것은 모델의 안전성을 과대평가할 수 있습니다.’

다른 연구에서도 유사한 행동을 관찰했습니다. 스탠퍼드 대학교의 연구에서는 LLM이 평가 중인지 인식할 수 있으며, 더 ‘ likable’하거나 ‘사회적으로 바람직한’ 행동을 보일 수 있다고 발견했습니다.

연구자들은 모델이 평가 목적을 추론할 수 있는지 테스트했습니다. 모델은 평가 전사본을 받았고, 평가 목적을 분류하라는 질문을 받았습니다.

모델은 평가 전사본이 실제 사용인지 테스트인지 분류할 수 있었습니다. 그러나 평가 목적을 분류하는 데는 더 어려움을 겪었습니다.

방법

연구자들은 평가 벤치마크를 생성하기 위해 61개의 데이터셋에서 1,000개의 전사본을 수집했습니다. 이 데이터셋에는 SWE-bench, WMDP, MMLU, XStest, GAIA, AgentHarm, ShareGPT, Deep Research, Safetybench, Civics, RealToxicityPrompts가 포함되어 있습니다.

자료는 평가와 배포 시나리오 사이에서 균형을 유지했으며, 간단한 채팅 상호작용과 더 복잡한 에이전트 세션으로 나누어졌습니다.

평가 데이터는 이유, 코딩, 사이버 보안, 일반 지식에 대한 능력 테스트와 윤리, 안전, 거부 행동에 대한 정렬 테스트를 포함했습니다. 배포 데이터는 사용자 상호작용에서 가져왔습니다.

에이전트 데이터를 보완하기 위해, 연구자들은 오케스트레이션 프레임워크를 사용하여 추가 예시를 생성했습니다.

연구자들은 모델이 평가 전사본을 식별할 수 있는지 테스트했습니다. 모델은 대화 기록과 평가 전사본이 테스트에서 왔는지 여부를 묻는 질문을 받았습니다.

모델은 평가 전사본을 식별할 수 있었습니다. 그러나 평가 목적을 분류하는 데는 더 어려움을 겪었습니다.

무엇이 다르죠?

연구자들은 모델이 평가 목적을 추론할 수 있는지 테스트했습니다. 모델은 평가 전사본을 받았고, 평가 목적을 분류하라는 질문을 받았습니다.

모델은 평가 전사본이 실제 사용인지 테스트인지 분류할 수 있었습니다. 그러나 평가 목적을 분류하는 데는 더 어려움을 겪었습니다.

데이터와 테스트

연구자들은 9개의 모델을 테스트했습니다. 이 모델들은 GPT-4.1, Claude 3.7, claude-3.5-sonnet-new, claude-3.7-sonnet, gemini-2.5-flash, gemini-2.5-pro, gpt-4o, gpt-4.1, gpt-4.1-mini, o4-mini가 포함되어 있습니다.

모델은 평가 전사본을 식별할 수 있었습니다. 그러나 평가 목적을 분류하는 데는 더 어려움을 겪었습니다.

모델은 평가 전사본이 실제 사용인지 테스트인지 분류할 수 있었습니다. 그러나 평가 목적을 분류하는 데는 더 어려움을 겪었습니다.

벤치마크 메모리

모델은 평가 전사본이 테스트에서 왔는지 여부를 결정할 때, 명백한 단서를 사용했습니다. 그러나 더 강력한 모델은 더 미묘한 단서를 사용했습니다.

연구자들은 모델이 평가 전사본을 식별할 수 있는지 테스트했습니다. 모델은 대화 기록과 평가 전사본이 테스트에서 왔는지 여부를 묻는 질문을 받았습니다.

모델은 평가 전사본을 식별할 수 있었습니다. 그러나 평가 목적을 분류하는 데는 더 어려움을 겪었습니다.

결론

LLM이 테스트 중인지 인식하는 것은 인간이 의도적으로 프로그래밍한 결과가 아니라, 모델의 훈련 과정에서 tự發적으로 나타나는 특성입니다.

이것은 모델의 안전성과 신뢰성을 평가하는 데 어려움을 줄 수 있습니다. 모델이 테스트 중인지 인식하는 것은 실제 사용과 다르게 행동할 수 있기 때문입니다.

현재, 모델의 평가 인식에 대한 즉각적인 해결책은 없습니다. 모델의 블랙박스 특성으로 인해, 모델의 행동을 평가해야 합니다.

 

* 자세한 내용은 원본 논문에서 확인하십시오.

연구자들은 그러나 이것이 가장 높은 추정치일 수 있다고 주장합니다. 평가자들은 데이터셋과 AI 평가 방법에 매우 익숙했기 때문입니다.

†† 평가자들이突然 나타난 것은 논문의 문장으로 인해 불분명합니다.

最初에 2025년 6월 4일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai