Góc nhìn Anderson
Trí tuệ nhân tạo khó tuân thủ sổ tay nhân viên
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN.jpg)
Một chuẩn mực mới cho thấy rằng các tác nhân AI trong nơi làm việc bỏ qua các quy định của công ty, thực hiện các hành động bị cấm như sa thải không được ủy quyền – sau đó báo cáo sai rằng họ đã tuân thủ.
Một nghiên cứu mới thú vị đã đặt các mô hình LLM hàng đầu vào vị trí phải tuân theo các hướng dẫn trong một công ty mô phỏng, tôn trọng tất cả các quy định của sổ tay nhân viên (được tạo bởi các chuyên gia lĩnh vực con người), cũng như đàm phán các chỉ thị mâu thuẫn hoặc khó hiểu từ cấp dưới và cấp trên, và thực hiện các nhiệm vụ dựa trên PDF, bài đăng Jira và các nền tảng và công cụ khác từ một kịch bản văn phòng con người điển hình.
Nếu bạn đã từng làm việc trong một văn phòng (hoặc ít nhất đã xem Office Space), bạn sẽ nhận ra các tín hiệu mâu thuẫn và tỷ lệ tín hiệu trên tiếng ồn mà các tác giả của công việc mới này đã ném vào các mô hình ngôn ngữ:

Cơn bão các biến số mà nhiều công nhân văn phòng phải đối mặt hàng ngày, được cô đặc vào một môi trường ảo để kiểm tra các mô hình tiền phong agentic. Nguồn
Thách thức chính mà thậm chí các hệ thống AI tiên tiến nhất cũng phải đối mặt ở đây là cần phải giữ lại sổ tay Quan hệ Nhân viên như một bộ lọc cho tất cả các lệnh tiếp theo. Nếu bạn đã từng cố gắng để ChatGPT hoặc Claude nhớ các hướng dẫn bạn đã đưa ra ở đầu của một phiên, bạn sẽ biết rằng cửa sổ ngữ cảnh của AI thường khiến nó quên các lệnh trước đó và quay trở lại hành vi mặc định của nó.
Đây là lý do tại sao, trong các thử nghiệm, Claude Fable 5, GPT-5.5 và các mô hình hàng đầu khác đã sa thải nhân viên sau khi nhận lệnh từ một giám đốc điều hành không có thẩm quyền; phê duyệt hóa đơn mà không có chữ ký phê duyệt của người quản lý cần thiết; chấp nhận kết quả phòng thí nghiệm đã hết hạn mà chính sách công ty đã từ chối rõ ràng; và sau đó báo cáo rằng họ đã tuân thủ sổ tay – trong số nhiều vi phạm chính sách công ty khác.
Các tác giả của công việc mới này cho biết:
‘Các thất bại tuân theo các mẫu nhất quán: các tác nhân cho phép một yêu cầu hợp lý trong môi trường vượt qua chính sách đang hoạt động, thực hiện một kiểm tra cần thiết và sau đó hành động chống lại kết quả của nó, mất chi tiết quy tắc trên các đường chân trời dài, và báo cáo tuân thủ mà họ không đạt được.’
Phân tích thất bại chứa một số ví dụ thú vị: trong một nhiệm vụ tài chính, Claude Opus 4.8 đã đúng khi phát hiện ra một khoản chi phí 7.500 đô la đã được phê duyệt bởi cùng một nhà phân tích junior đã gửi nó, vi phạm chính sách công ty.
Sau đó, nó lý luận bản thân mình vào việc tin rằng nhà phân tích thực sự là Giám đốc Tài chính và phê duyệt thanh toán bất chấp:
‘Sau khi thăng cấp cho anh ta trong chuỗi suy nghĩ của mình, mô hình đã xóa mục đó, sau đó gửi tin nhắn cho Giám đốc Tài chính thực sự để xác nhận rằng mọi mục trên 5.000 đô la đã có phê duyệt tài liệu.’
‘Thất bại không phải là một khả năng bị thiếu; mọi事 thực cần thiết cho quyết định chính xác đã được mô hình tự mình thu thập.’

Cách Claude Opus 4.8 không thể hòa giải 7.500 đô la.
Ở nơi khác, Gemini 3.5 Flash đã gửi giấy tờ bảo hiểm sử dụng kết quả phòng thí nghiệm đã hết hạn mà không thậm chí mở báo cáo phòng thí nghiệm, mặc dù ngày thu thập xuất hiện trong tên tệp:
‘Gemini 3.5 Flash đã gửi ủy quyền trước cho người bảo hiểm mà không có một cuộc gọi đọc duy nhất đối với tệp PDF phòng thí nghiệm, sau đó báo cáo rằng nó đã xử lý trường hợp “theo Thủ tục vận hành Tiêu chuẩn”.’
Trên toàn bộ chuẩn mực, các tác giả cũng tìm thấy rằng nhiều mô hình tự tin tuyên bố họ đã tuân theo mọi quy định công ty, trong khi trích dẫn các phần sổ tay mà họ vừa vi phạm.
Giải thích thêm thường không giúp được; ví dụ, GPT-5.5 không cho thấy sự cải thiện với nỗ lực lý luận tăng lên, trong khi một số mô hình thực hiện tệ hơn, rõ ràng lý luận bản thân mình khỏi quyết định chính xác.
Trong kết quả cuối cùng, Claude Fable 5 đã đạt được tỷ lệ đậu nghiêm ngặt cao nhất tại 36,2%; GPT-5.6 Sol đứng thứ hai tại 23,5%; và GPT-5.5 và Claude Opus 4.8 mỗi đạt 21,5–21,9%.
Hầu hết các mô hình còn lại được đánh giá đạt dưới 16%, và hầu hết các cấu hình tiền phong đạt dưới 25% theo các tiêu chí đánh giá nghiêm ngặt của chuẩn mực:
Tác nhân AI hàng đầu đã hoàn thành hơn một phần ba các nhiệm vụ nơi làm việc được quản lý bởi chính sách của chuẩn mực, trong khi hầu hết các mô hình hàng đầu khác không đạt được hơn ba phần tư dưới đánh giá nghiêm ngặt. Nguồn
Để khắc phục, các tác giả cho rằng các chính sách công ty quan trọng nên được thực thi bên ngoài AI bằng cách sử dụng các kiểm tra công cụ xác định (tức là các kiểm tra được mã hóa cứng ngăn chặn các hành động bị cấm), thay vì chỉ dựa vào bộ nhớ ngữ cảnh dài alone.
Họ cũng đề xuất sử dụng HANDBOOK.md itself như một chuẩn mực tiêu chuẩn để đo lường và theo dõi các cải tiến trong việc tuân thủ chính sách ngữ cảnh dài, khi các mô hình agentic tương lai được phát triển.
Bài báo mới có tiêu đề HANDBOOK.md: Một chuẩn mực cho việc tuân theo hướng dẫn agentic ngữ cảnh dài, và đến từ bảy tác giả tại surge.ai. Bài báo đi kèm với một kho lưu trữ GitHub chứa các tệp docker và các yêu cầu khác để tái tạo các thử nghiệm.
Phương pháp
Sáu mươi lăm kịch bản văn phòng mô phỏng đã được tạo cho chuẩn mực HANDBOOK.md, bao gồm tài chính; Nhân sự; bảo hiểm; hậu cần; và hóa đơn y tế; và mỗi kịch bản đặt mô hình vào một môi trường công ty được chứa hóa, bao gồm tệp, email, cuộc trò chuyện Slack, lịch, bảng Jira và các công cụ nơi làm việc khác.
Mỗi nhiệm vụ đều được quản lý bởi một sổ tay có từ 20 đến 124 trang, được cung cấp dưới dạng tệp PDF, Word hoặc HTML, thay vì được nhúng vào lời nhắc, buộc mô hình phải tìm, đọc và áp dụng các quy tắc liên quan trong suốt nhiệm vụ.
Mười sổ tay cơ bản được viết bởi các chuyên gia đã được điều chỉnh từ các chính sách thực tế của ngành, sau đó mỗi nhiệm vụ nhận được phiên bản riêng với các chuỗi phê duyệt, ngưỡng và quy trình khác nhau, để ngăn chặn học thuộc:
‘Các chuyên gia lĩnh vực đã viết mười sổ tay cơ bản bằng cách điều chỉnh các chính sách thực tế từ các ngành của họ. Mỗi sổ tay là một tài liệu vận hành dài, nhiều phần, chứ không phải là danh sách quy tắc. ‘
‘Một sổ tay Nhân sự đại diện chứa 19 phần được đánh số: tổng quan, định nghĩa, nhóm Nhân sự và liên hệ, bản đồ kênh Slack, tệp tham chiếu và hệ thống, phân loại yêu cầu, quy tắc định tuyến và phân loại, ma trận ưu tiên với SLA, thủ tục cho việc tuyển dụng, sa thải, nghỉ phép, hiệu suất và tuyển dụng, đường dẫn nâng cao, quy tắc dọn dẹp email và thư viện các mẫu và định dạng mặc định cần thiết’
Sự thành công được đo lường bằng 824 kiểm tra xác định Python, bao gồm cả các hành động cần thiết và các hành động bị cấm – cho phép chuẩn mực phát hiện không chỉ liệu một nhiệm vụ đã được hoàn thành, mà còn liệu chính sách công ty đã bị vi phạm trong quá trình thực hiện.
Thirty mô hình cấu hình từ 11 nhà cung cấp đã được đánh giá; và trong các thử nghiệm, mỗi nhiệm vụ lặp lại bốn lần trong các điều kiện giống hệt.
Không giống như các chuẩn mực thông thường, HANDBOOK.md đánh giá cả việc các hành động cần thiết đã được hoàn thành và các hành động bị cấm đã được tránh, cho phép các tác nhân thất bại, mặc dù đã hoàn thành nhiệm vụ được yêu cầu
Môi trường và Công cụ
Mỗi môi trường làm việc mô phỏng được thiết kế để chạy trong một môi trường Docker tiêu chuẩn, cho phép mỗi mô hình truy cập vào cùng một tập hợp các công cụ, trong khi ngăn chặn sự khác biệt trong tính khả dụng của phần mềm ảnh hưởng đến kết quả. Chuẩn mực trình bày cho các tác nhân một không gian làm việc văn phòng thực tế, bao gồm truy cập tệp, cùng với các dịch vụ doanh nghiệp đã đề cập (tức là Gmail, Slack, v.v.):
Một biểu diễn thô của môi trường văn phòng mà các mô hình phải hoạt động trong.
Các môi trường cũng bảo tồn mỗi hành động được thực hiện bởi tác nhân, cho phép hệ thống đánh giá xác định của chuẩn mực đánh giá toàn bộ chuỗi hành động dẫn đến kết quả cuối cùng.
Đo lường
Hiệu suất được đo lường chủ yếu bằng cách sử dụng đậu nghiêm ngặt @1, theo đó một nhiệm vụ chỉ được coi là thành công nếu mọi tiêu chí đánh giá được đáp ứng. Bất kỳ yêu cầu bị bỏ lỡ hoặc vi phạm chính sách nào cũng sẽ dẫn đến thất bại, phản ánh các thiết lập doanh nghiệp, nơi một hành động không chính xác duy nhất có thể làm mất hiệu lực một quy trình có năng lực khác.
Một số liệu đo lường dễ dãi hơn, đậu @1 (N−1), cũng được sử dụng, trong đó một tiêu chí thất bại được phép cho mỗi nhiệm vụ, để phân biệt các gần như thất bại với các thất bại hoàn toàn.
Để phân tích thêm, điểm số trung bình của mỗi mô hình trên mỗi tiêu chí được ghi lại, mặc dù điều này không được sử dụng trong các xếp hạng tiêu đề của chuẩn mực.
Phương pháp tiếp cận chung
Mười sổ tay cơ bản được viết bởi các chuyên gia đã được điều chỉnh từ các chính sách công ty thực tế, sau đó mỗi sổ tay được sửa đổi thành nhiều phiên bản nhiệm vụ cụ thể với các chuỗi phê duyệt, ngưỡng và quy trình khác nhau. Các môi trường văn phòng thực tế đã được xây dựng xung quanh mỗi sổ tay, bao gồm email, lịch, cuộc trò chuyện Slack, bảng tính và các tài liệu nơi làm việc khác.
Mỗi nhiệm vụ đã được tinh chỉnh thông qua các thử nghiệm lặp đi lặp lại cho đến khi các tiêu chí đánh giá đáng tin cậy phân biệt các thất bại thực sự của mô hình với các khiếm khuyết trong chính chuẩn mực.
Thử nghiệm và Kết quả
Ngay cả các mô hình mạnh nhất cũng thất bại trong hầu hết các nhiệm vụ theo hệ thống đánh giá nghiêm ngặt của chuẩn mực, với hiệu suất phân bố trên một phạm vi rộng, chứ không phải tập trung ở đầu:

Bảng xếp hạng ban đầu của tất cả 30 cấu hình mô hình được đánh giá theo điểm đậu nghiêm ngặt @1 trên chuẩn mực HANDBOOK.md. Điểm số đại diện cho tỷ lệ nhiệm vụ nơi làm việc của chuẩn mực được hoàn thành mà không có một tiêu chí đánh giá thất bại duy nhất trong bốn thử nghiệm cho mỗi nhiệm vụ. Các điểm số bị ràng buộc chia sẻ cùng một thứ hạng.
Sự khác biệt giữa các thiết lập lý luận cũng được tìm thấy là thay đổi đáng kể theo mô hình, với lý luận bổ sung đôi khi cải thiện hiệu suất; đôi khi không có sự khác biệt; và đôi khi giảm nó:
‘Nỗ lực [lý luận] giúp không đồng đều. Tăng nỗ lực cải thiện Opus 4.8 (+3.0), Sonnet 4.6 (+2.7) và Fable 5 (+2.0), để GPT-5.5 không thay đổi (21,5% ở cả hai thiết lập) và làm tổn hại GLM 5.2 (−2.7). ‘
‘Suy nghĩ thêm dường như chuyển thành tuân thủ quy tắc chỉ khi thất bại cơ bản là một suy luận bị bỏ lỡ chứ không phải một [đọc] bị bỏ lỡ.’
Claude Fable 5 đã đạt được điểm số cao nhất tại 36,2%, tiếp theo là Claude Fable 5 tại 34,2% và GPT-5.6 Sol (tối đa) tại 23,5%. GPT-5.5 và Claude Opus 4.8 hình thành tầng tiếp theo, ở mức khoảng 20%, trong khi hầu hết các mô hình tiền phong còn lại đạt dưới 16%. Các mô hình xếp hạng thấp nhất đã hoàn thành ít hơn 2% nhiệm vụ.
Phân tích thất bại chi tiết của bài báo cho thấy rằng vấn đề thường không phải là thiếu thông tin, vì các quy tắc sổ tay và bằng chứng hỗ trợ liên quan đã thường được thu thập – nhưng lý luận bổ sung đôi khi sẽ khiến mô hình từ bỏ kết luận chính xác để ủng hộ một kết luận vi phạm chính sách nhưng có khả năng xảy ra.
Bài báo cũng lưu ý đến mức độ tự lừa dối mà đặc trưng cho nhiều nỗ lực của LLM:
‘Gần như mọi đường dẫn thất bại đều kết thúc với một tuyên bố tự tin rằng sổ tay đã được tuân theo, thường trích dẫn các phần cụ thể mà chúng đã vi phạm. Các báo cáo được chi tiết, được cấu trúc tốt và sai […]
‘[…] Trên toàn bộ chuẩn mực, báo cáo tự của tác nhân là hiện vật ít tin cậy nhất trong đường dẫn, điều này quan trọng đối với bất kỳ triển khai nào hiển thị tóm tắt tác nhân cho con người làm bằng chứng về những gì đã được thực hiện.’
Tóm lại, các tác giả kết luận rằng lý luận ngữ cảnh dài một mình không thể khiến AI doanh nghiệp tuân thủ chính sách công ty một cách đáng tin cậy. Thay vào đó, tuân thủ chính sách nên ngày càng được thực thi thông qua các kiểm soát bên ngoài xác định, ngoài các rào chắn trong quy trình.
Kết luận
Ý kiến Một điều thú vị cần xem xét là mức độ mà các môi trường như những môi trường được tạo ra cho các thí nghiệm sẽ được tưởng tượng lại để tạo điều kiện cho AI, thay vì buộc LLM phải giải thích các biểu mẫu và định dạng xác định môi trường văn phòng con người. Ví dụ,昨 ngày, lần đầu tiên, một liên hệ kinh doanh đã gửi cho tôi một bản tóm tắt .md được thiết kế để được khám phá bởi một LLM, thay vì được đọc theo cách tuyến tính.
Và tôi cũng đang ngày càng áp dụng và thích nghi với các hạn chế trực quan và văn bản trong quá trình trò chuyện LLM, cũng như chọn và chấp nhận các định dạng tệp mà tôi không thường chọn, vì chúng phù hợp với quy trình làm việc của LLM một cách khéo léo hơn.
Do đó, trong khi việc xem các mô hình tiền phong vấp ngã trong thế giới của David Brent là thú vị, người ta tự hỏi liệu đây có phải là kịch bản có khả năng xảy ra nhất cho ‘công nhân văn phòng agentic’.
Được xuất bản lần đầu vào thứ Tư, ngày 29 tháng 7 năm 2026. Cập nhật 18:41 EET, sửa liên kết bị hỏng.












