Anderson의 관점

AI가 직원 핸드북을 준수하는 데 어려움을 겪다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

새로운 벤치마크는 직장 AI 에이전트가 회사 규칙을 무시하고, 무단 해고와 같은 금지된 행동을 수행한 뒤, 자신이 준수했다고 허위 보고한다는 것을 발견했습니다.

 

흥미로운 새로운 연구에서는 선도적인 LLM 모델들을 시뮬레이션된 회사 환경에서 지시를 따르게 하여, 인간 도메인 전문가가 만든 직원 핸드북의 모든 조항을 준수하도록 요구하고, 하위 및 상위 직원으로부터의 상충하거나 혼란스러운 지시와 업데이트를 협상하며, PDF, Jira 게시물 및 일반적인 인간 사무실 시나리오에서 사용되는 기타 친숙한 플랫폼과 도구를 기반으로 작업을 수행하도록 했습니다.

사무실에서 일해 본 적이 있거나 최소한 Office Space를 본 적이 있다면, 저자들이 언어 모델에 던진 모순된 신호와 당혹스러운 신호 대 잡음 비율을 인식할 수 있을 것입니다:

The storm of variables many office workers must contend with daily, distilled into a virtual environment to test agentic frontier models. Source - https://surgehq.ai/blog/handbook-md

많은 사무직 근로자들이 매일 마주해야 하는 변수들의 폭풍을 가상 환경으로 추출하여 에이전시 프론티어 모델을 테스트합니다. 출처

여기서 가장 앞선 AI 시스템조차도 직면하는 핵심 과제는 제공된 직원 관계 매뉴얼을 모든 이후 명령에 대한 필터로 유지해야 한다는 점입니다. 세션 초기 단계에서 내린 지시를 기억하도록 ChatGPT나 Claude에게 애쓰는 경험이 있다면, AI의 컨텍스트 윈도우가 이전 프롬프트를 잊고 기본 행동으로 돌아가는 경우가 많다는 것을 알게 될 것입니다.

이 때문에 테스트에서 Claude Fable 5, GPT-5.5 및 기타 선도 모델들은 권한이 없는 임원으로부터 명령을 받아 직원을 해고하고, 필요한 관리자 승인 없이 청구서를 승인하며, 회사 정책이 명시적으로 거부하는 만료된 실험실 결과를 받아들인 뒤, 자신들이 핸드북을 충실히 따랐다고 보고했습니다 – 이 외에도 수많은 회사 정책 위반 사례가 있었습니다.

‘실패는 일관된 패턴을 따릅니다: 에이전트가 환경 내에서 타당해 보이는 요청이 기존 정책을 무시하도록 하고, 필요한 검사를 수행한 뒤 결과에 반하는 행동을 하며, 장기적인 상황에서 규칙 세부 사항을 잃어버리고, 달성하지 못한 준수를 보고합니다.’

실패 분석에는 몇 가지 재미있는 예시가 포함됩니다: 한 금융 작업에서 Claude Opus 4.8은 $7,500 비용이 동일한 주니어 분석가에 의해 승인된 것을 정확히 발견했는데, 이는 회사 정책에 위배됩니다.

그는 이어서 해당 분석가가 실제로 재무 담당자(Finance Controller)라고 믿게 되었고 결제 승인을 진행했습니다:

‘모델이 자체 사고 흐름에서 그를 담당자로 승격시킨 뒤, 항목을 승인하고 실제 담당자에게 $5K 이상 모든 항목에 문서화된 승인이 있음을 확인하도록 메시지를 보냈습니다.

‘이 실패는 능력의 부재가 아니라; 올바른 결정을 위해 필요한 모든 사실이 모델 자체에 의해 검색되었습니다.’

How Claude Opus 4.8 failed to reconcile $7,500. Source - https://surgehq.ai/blog/handbook-md

Claude Opus 4.8이 $7,500을 조정에 실패한 방식.

다른 곳에서는 Gemini 3.5 Flash가 이미 만료된 실험실 결과를 사용해 보험 서류를 제출했으며, 파일명 자체에 수집 날짜가 표시되어 있음에도 불구하고 실험실 보고서를 열어보지 않았습니다:

‘Gemini 3.5 Flash는 실험실 PDF를 한 번도 읽지 않은 채 보험사에 사전 승인을 제출했고, 이후 “표준 운영 절차에 엄격히 따라 처리했다”고 보고했습니다.’

벤치마크 전반에 걸쳐 저자들은 많은 모델이 자신이 모든 회사 규칙을 따랐다고 자신 있게 주장하면서도, 방금 위반한 바로 그 핸드북 섹션을 인용하는 경우를 발견했습니다.

추가 추론은 종종 도움이 되지 않았습니다; 예를 들어 GPT-5.5는 추론 노력을 늘려도 개선되지 않았고, 일부 모델은 오히려 성능이 떨어져 올바른 결정을 추론 자체가 멀어지게 만들었습니다.

최종 결과에서 Claude Fable 5는 36.2%의 가장 높은 엄격 통과율을 기록했으며, GPT-5.6 Sol이 23.5%로 2위를 차지했습니다; GPT-5.5와 Claude Opus 4.8은 각각 21.5–21.9%를 기록했습니다.

나머지 평가된 모델 대부분은 16% 이하를 기록했으며, 대부분의 프론티어 구성은 벤치마크의 엄격 채점 기준에서 25% 이하를 기록했습니다:

The best-performing AI agent completed just over one-third of the benchmark's policy-governed workplace tasks, while most leading models failed more than three-quarters under strict evaluation. Source - https://cdn.prod.website-files.com/68dcd2ceb173c46fa029931c/6a3d6dad2852b9a91757a83e_leaderboard.png

가장 성능이 좋은 AI 에이전트는 벤치마크의 정책 기반 업무 중 약 3분의 1을 완료했으며, 대부분의 선도 모델은 엄격 평가에서 3/4 이상 실패했습니다. 출처

완화 방안으로 저자들은 중요한 회사 정책을 AI 외부에서 결정론적 툴-콜 가드(즉, 금지된 행동을 차단하는 하드코딩된 검사)를 통해 강제해야 한다고 주장합니다; 이는 긴 컨텍스트 메모리에만 의존하는 것보다 더 안전합니다.

또한 향후 에이전시 모델이 개발됨에 따라, HANDBOOK.md 자체를 장기 컨텍스트 정책 준수 개선을 측정하고 추적하는 표준화된 벤치마크로 활용할 것을 제안합니다.

새 논문은 여기에서 확인할 수 있으며, 제목은 HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following이며, surge.ai 소속 일곱 명의 저자가 공동 집필했습니다. 논문과 함께 GitHub 저장소가 제공되어 도커 파일 및 테스트 재현에 필요한 기타 자료를 포함하고 있습니다.

방법

HANDBOOK.md 벤치마크를 위해 65개의 시뮬레이션된 사무실 시나리오가 만들어졌으며, 이는 재무; 인사; 보험; 물류; 의료 청구 등 다양한 분야를 포괄하고, 각 시나리오는 파일, 이메일, Slack 대화, 캘린더, Jira 보드 및 기타 친숙한 업무 도구가 포함된 컨테이너화된 회사 환경에 모델을 배치합니다.

각 작업은 20~124 페이지 분량의 핸드북에 의해 규정되었으며, PDF, Word 또는 HTML 문서 형태로 제공되어 프롬프트에 직접 삽입되지 않음으로써 모델이 해당 규칙을 찾아 읽고 작업 전반에 적용하도록 강제했습니다.

10개의 전문가가 작성한 기본 핸드북은 실제 산업 정책을 기반으로 조정되었으며, 이후 각 작업마다 승인 권한, 임계값, 유효 기간 및 절차 규칙이 다른 변형 버전이 제공되어 암기 방지를 목표로 했습니다:

‘도메인 전문가들은 실제 산업 정책을 적용해 10개의 기본 핸드북을 작성했습니다. 각 핸드북은 규칙 목록이 아니라 다섯 개 이상의 섹션으로 구성된 장문의 운영 문서입니다.

‘대표적인 인사 핸드북은 19개의 번호 매겨진 섹션을 포함합니다: 개요, 정의, 인사팀 및 연락처, Slack 채널 맵, 참고 파일 및 시스템, 요청 분류, 트리아지 및 라우팅 규칙, SLA가 포함된 우선순위 매트릭스, 온보딩·오프보딩·휴가·성과·채용 절차, 에스컬레이션 경로, 이메일 관리 규칙, 필수 템플릿 및 기본 형식 라이브러리 등.

성공은 824개의 결정론적 Python 기반 검증 체크를 통해 측정되었으며, 여기에는 필수 행동과 금지 행동 모두가 포함되어 있어 벤치마크가 작업 완료 여부뿐 아니라 정책 위반 여부도 감지할 수 있었습니다.

11개 제공업체의 30가지 모델 구성에 대해 평가했으며, 테스트 동안 각 작업은 동일한 조건에서 네 번 반복되었습니다.

전통적인 벤치마크와 달리, HANDBOOK.md는 필수 행동이 완료되었는지와 금지 행동이 회피되었는지를 모두 평가하여, 요청된 작업을 완료했음에도 에이전트가 실패하도록 허용합니다.

환경 및 도구

각 시뮬레이션된 작업장은 표준화된 Docker 환경 내에서 실행되도록 설계되어, 모든 모델이 동일한 도구 세트에 접근할 수 있게 하며, 소프트웨어 가용성 차이가 결과에 영향을 주는 것을 방지합니다. 벤치마크는 모델에게 파일 접근과 앞서 언급한 엔터프라이즈 서비스(Gmail, Slack 등)를 포함하는 현실적인 사무실 작업 공간을 제공합니다:

A rough representation of the office environment the models must operate within.

모델이 작동해야 하는 사무실 환경의 대략적인 표현.

이 환경은 또한 에이전트가 수행한 각 행동을 보존하여, 벤치마크의 결정론적 평가 시스템이 최종 결과에 이르는 전체 행동 순서를 평가할 수 있게 합니다.

측정항목

성능은 주로 strict pass@1을 사용해 측정했으며, 이 경우 모든 평가 기준을 충족해야 작업이 성공으로 간주됩니다. 하나라도 요구 사항을 놓치거나 정책을 위반하면 실패로 처리되어, 단일 잘못된 행동이 전체 워크플로를 무효화할 수 있는 기업 환경을 반영합니다.

보다 관대한 지표인 pass@1 (N−1)도 사용했으며, 이는 작업당 하나의 실패 기준을 허용해 근접 실패와 완전 실패를 구분할 수 있게 합니다.

추가 분석을 위해 각 모델의 평균 기준당 점수를 기록했지만, 이는 벤치마크 주요 순위에는 반영되지 않았습니다.

일반적인 접근 방식

전문가가 작성한 10개의 핸드북을 실제 회사 정책에서 변형했으며, 이후 각 핸드북을 여러 작업별 버전으로 수정해 승인 체계, 임계값 및 절차가 다르게 설정되었습니다. 현실적인 사무실 환경은 모든 핸드북 주변에 이메일, 캘린더, Slack 대화, 스프레드시트 및 기타 업무 산출물을 포함하도록 구축되었습니다.

각 작업은 반복 테스트를 거쳐 평가 기준이 모델의 실제 실패와 벤치마크 자체의 결함을 명확히 구분하도록 정교화되었습니다. 올바른 행동을 거부하거나 잘못된 해결책을 허용하는 기준은 출시 전에 수정되었습니다.

테스트 및 결과

가장 강력한 모델조차도 벤치마크의 엄격 채점 시스템 하에서 대부분의 작업에 실패했으며, 성능은 특정 모델에 집중되지 않고 넓은 범위에 걸쳐 분포했습니다:

The initial results leaderboard ranking all 30 evaluated model configurations by their strict pass@1 scores on the HANDBOOK.md benchmark. Scores represent the percentage of the benchmark's 65 workplace tasks completed without a single failed evaluation criterion across four trials per task. Tied scores share the same rank.

HANDBOOK.md 벤치마크에서 30개의 평가된 모델 구성을 엄격 pass@1 점수 기준으로 순위 매긴 초기 결과 리더보드. 점수는 각 작업당 4번의 시도에서 단 하나의 평가 기준도 실패하지 않고 완료된 65개 업무 비율을 나타냅니다. 동점은 동일 순위로 표시됩니다.

추론 설정 간 차이는 모델에 따라 크게 달라졌으며, 추가 추론이 성능을 향상시키는 경우도, 거의 차이가 없는 경우도, 그리고 성능을 감소시키는 경우도 있었습니다:

‘[Reasoning] 노력은 고르지 않게 작용합니다. 노력 증가가 Opus 4.8 (+3.0), Sonnet 4.6 (+2.7), Fable 5 (+2.0)를 향상시키는 반면, GPT-5.5는 동일하게 유지(두 설정 모두 21.5%)하고, GLM 5.2는 감소(-2.7)합니다.

‘추가 심사는 기본 실패가 [읽기] 누락이 아닌 추론 누락일 때만 규칙 준수로 전환되는 것으로 보입니다.’

Claude Fable 5는 36.2%로 가장 높은 점수를 기록했으며, 뒤이어 Claude Fable 5가 34.2%, GPT-5.6 Sol(최대)이 23.5%를 기록했습니다. GPT-5.5와 Claude Opus 4.8은 각각 약 20% 수준으로 다음 티어를 형성했으며, 대부분의 나머지 프론티어 모델은 16% 이하를 기록했습니다. 최하위 모델은 2% 미만의 작업을 완료했습니다.

논문의 상세 실패 분석에 따르면 문제는 종종 정보 부족이 아니라, 관련 핸드북 규칙과 증거가 이미 검색되었음에도 불구하고 추가 추론이 모델을 올바른 결론에서 벗어나 정책 위반 가능성이 높은 결론으로 이끌었다는 점을 시사합니다.

또한 이 연구는 많은 LLM이 보이는 자기 착각 정도를 강조합니다:

‘거의 모든 실패 경로는 핸드북을 따랐다고 자신 있게 진술하며, 위반된 구체적인 섹션을 자주 인용합니다. 보고서는 상세하고 구조화되어 있지만 잘못되었습니다 […]’

‘[…] 벤치마크 전반에 걸쳐, 에이전트의 자체 보고는 경로에서 가장 신뢰할 수 없는 산물이며, 이는 인간에게 에이전트 요약을 증거로 제공하는 모든 배포에 영향을 미칩니다.’

마지막으로, 저자들은 장기 컨텍스트 추론만으로는 기업 AI가 회사 정책을 신뢰성 있게 따르기 어렵다고 결론짓습니다. 대신 정책 준수는 워크플로 가드레일과 함께, 결정론적 외부 제어를 통해 점점 더 강제되어야 한다고 제안합니다.

결론

의견 한 가지 흥미로운 고려사항은 실험을 위해 만든 환경이 AI를 지원하도록 재구성될 가능성입니다; 이는 LLM이 인간 사무실 환경을 정의하는 동일한 양식과 형식을 해석하도록 강요하는 대신, AI에 맞게 설계되는 방향을 의미합니다. 예를 들어, 어제 처음으로 비즈니스 연락처가 LLM이 탐색하도록 설계된 .md 개요를 보냈습니다; 이는 선형적으로 읽히는 것이 아니라 LLM을 위해 만든 것입니다.

그리고 저 역시 LLM 대화 중에 시각적·텍스트적 제약을 점점 더 수용하고 적응하고 있으며, LLM 워크플로에 더 능숙하게 맞추기 위해 일반적으로 선택하지 않을 파일 형식도 선택하고 받아들이고 있습니다.

따라서, 프론티어 모델이 David Brent의 세계에서 비틀거리는 모습을 보는 것이 재미있지만, 이것이 ‘에이전시 사무직 근로자’에게 가장 가능성 높은 시나리오인지 궁금해집니다.

 

첫 게시일 2026년 7월 29일 수요일. 18:41 EET 업데이트, 깨진 링크 수정.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai