Kąt Andersona
Trudności AI w przestrzeganiu przepisów firmy
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN.jpg)
Nowe badanie wykazało, że agenci AI w miejscu pracy ignorują zasady firmy, wykonują zabronione czynności, takie jak nieautoryzowane zwolnienia, a następnie fałszywie raportują, że przestrzegali przepisów.
Interesujące nowe badanie umieściło wiodące modele LLM w sytuacji, w której musiały wykonywać polecenia w symulowanej firmie, przestrzegając wszystkich zasad podanych w podręczniku pracownika (stworzonym przez ekspertów ds. dziedziny), a także negocjować z potokami sprzecznych lub mylących dyrektyw i aktualizacji od podwładnych i przełożonych, oraz wykonywać zadania na podstawie plików PDF, postów Jira i innych znanych platform i narzędzi z typowego biurowego środowiska.
Jeśli kiedykolwiek pracowałeś w biurze (lub przynajmniej widziałeś Office Space), rozpoznasz sprzeczne sygnały i zaskakujący stosunek sygnału do szumu, który autorzy nowej pracy rzucili na modele językowe:

Burza zmiennych, z którymi muszą się zmagać biurowi pracownicy na co dzień, destylowana do wirtualnego środowiska w celu przetestowania agentywnych modeli frontierowych. Źródło
Kluczowym wyzwaniem, przed którym stają nawet najbardziej zaawansowane systemy AI, jest konieczność zachowania podręcznika relacji pracowniczych jak filtr dla wszystkich następnych poleceń. Jeśli kiedykolwiek miałeś problemy z tym, aby ChatGPT lub Claude zapamiętały polecenia, które im dałeś na początku sesji, wiesz, że okno kontekstowe AI często powoduje, że zapomina wcześniejszych poleceń i wraca, stale, do swojego zachowania domyślnego.
To dlatego w testach Claude Fable 5, GPT-5.5 i inne wiodące modele zwolniły pracowników po otrzymaniu poleceń od dyrektora, który nie miał do tego uprawnień; zatwierdziły faktury bez wymaganego podpisu menedżera; zaakceptowały wygasłe wyniki laboratoryjne, które polityka firmy wyraźnie odrzuciła; a następnie zgłosiły, że wiernie przestrzegały podręcznika – wśród wielu innych naruszeń polityki firmy.
Autorzy nowej pracy stwierdzają:
‘Niewłaściwości występują według stałych wzorców: agenci pozwalają na prawdopodobne żądanie w środowisku, które zastępuje obowiązującą politykę, wykonują wymagane sprawdzenie, a następnie działają przeciwko jego wynikowi, tracą szczegóły zasad na długich horyzontach i zgłaszają zgodność, której nie osiągnęli.’
Analiza niepowodzeń zawiera kilka zabawnych przykładów: w jednym zadaniu finansowym Claude Opus 4.8 poprawnie ustalił, że wydatek w wysokości 7 500 dolarów został zatwierdzony przez tego samego młodszego analityka, który go złożył, co naruszało politykę firmy.
Następnie uzasadnił sobie, że analityk był naprawdę kontrolerem finansowym i zatwierdził płatność:
‘Po awansowaniu go do kontrolera finansowego w swojej własnej myśli model zatwierdził płatność, a następnie wysłał wiadomość do prawdziwego kontrolera finansowego, aby potwierdzić, że każdy przedmiot o wartości powyżej 5 000 dolarów miał udokumentowane zatwierdzenie.
‘Niepowodzenie nie jest brakiem zdolności; każdy fakt wymagany do podjęcia prawidłowej decyzji został już pobrany przez sam model.’

Jak Claude Opus 4.8 nie udało się uzgodnić 7 500 dolarów.
W innym miejscu Gemini 3.5 Flash złożył dokumenty ubezpieczeniowe, używając wyników laboratoryjnych, które już wygasły, bez nawet otwarcia raportu laboratoryjnego, pomimo że data zbierania pojawiła się w nazwie pliku:
‘Gemini 3.5 Flash złożył upoważnienie do ubezpieczyciela bez jednego wywołania odczytu przeciwko plikowi PDF laboratoryjnemu, a następnie zgłosił, że przetworzył sprawę “ścisłe według standardowej procedury operacyjnej”.’
Na całym benchmarku autorzy stwierdzili również, że wiele modeli z pewnością twierdziło, że przestrzegało każdą zasadę firmy, podając jednocześnie te same sekcje podręcznika, które właśnie naruszyły.
Dodatkowe uzasadnienie często nie pomagało; na przykład GPT-5.5 nie wykazał poprawy przy zwiększonym wysiłku uzasadniania, podczas gdy niektóre modele działały jeszcze gorzej, wydawało się, że uzasadniając się od właściwej decyzji.
W końcowych wynikach Claude Fable 5 osiągnął najwyższy ścisły wskaźnik zaliczenia na poziomie 36,2%; GPT-5.6 Sol zajął drugie miejsce z wynikiem 23,5%; a GPT-5.5 i Claude Opus 4.8 każdy uzyskał wynik 21,5–21,9%.
Większość pozostałych ocenianych modeli uzyskała wynik poniżej 16%, a większość konfiguracji frontierowych uzyskała wynik poniżej 25% według surowych kryteriów oceny benchmarku:

Najlepiej radzący sobie agent AI ukończył nieco ponad jedną trzecią zadań benchmarku, podczas gdy większość wiodących modeli nie powiodła się w więcej niż trzech czwartych zadań pod surową oceną. Źródło
W ramach naprawy autorzy twierdzą, że krytyczne zasady firmy powinny być egzekwowane poza AI przy użyciu deterministycznych strażników narzędzi (tj. zhakowanych sprawdzeń, które blokują zabronione działania), a nie polegając wyłącznie na długim kontekście pamięci.
Proponują również użycie samego HANDBOOK.md jako ustandaryzowanego benchmarku do mierzenia i śledzenia poprawy w długim kontekście przestrzegania polityki, podczas gdy opracowywane są przyszłe agentywne modele.
Nowy artykuł nosi tytuł HANDBOOK.md: Benchmark dla długiego kontekstu agentywnej instrukcji i pochodzi od siedmiu autorów z surge.ai. Artykuł jest zaopatrzony w repozytorium GitHub, zawierające pliki docker i inne wymagania do odtworzenia testów.
Metoda
Stworzono sześćdziesiąt pięć symulowanych scenariuszy biurowych dla benchmarku HANDBOOK.md, obejmujących finanse; HR; ubezpieczenia; logistykę; oraz rozliczanie medyczne; a każdy umieszcza model w środowisku firmy konteneryzowanej, zawierającej pliki, e-maile, rozmowy Slack, kalendarze, tablice Jira i inne znane narzędzia biurowe.
Każde zadanie było zarządzane przez podręcznik o objętości od 20 do 124 stron, dostarczany w postaci dokumentów PDF, Word lub HTML, a nie osadzony w prompie, zmuszając modele do znalezienia, odczytania i zastosowania odpowiednich zasad w trakcie zadania.
Dziesięć podręczników bazowych zostało napisanych przez ekspertów i dostosowanych do prawdziwych polityk branżowych, po czym każde zadanie otrzymało swoją własną zmodyfikowaną wersję z różnymi łańcuchami zatwierdzeń, progami i procedurami, aby zapobiec zapamiętaniu:
‘Eksperci branżowi napisali dziesięć podręczników bazowych, dostosowując je do prawdziwych polityk z ich branży. Każdy z nich jest długim, wielosekcyjnym dokumentem operacyjnym, a nie listą zasad.
‘Przedstawiony podręcznik HR zawiera 19 ponumerowanych sekcji: przegląd, definicje, zespół HR i kontakty, mapa kanału Slack, pliki referencyjne i systemy, taksonomie wniosków, reguły triage i routingu, macierz priorytetów z SLA, procedury dla onboardingu, offboardingu, urlopu, wydajności i rekrutacji, ścieżki eskalacji, reguły utrzymania poczty e-mail i biblioteka wymaganych szablonów i formatów domyślnych’
Sukces mierzono za pomocą 824 deterministycznych sprawdzeń Python, obejmujących zarówno wymagane działania, jak i zabronione – umożliwiając benchmarkowi wykrywanie nie tylko tego, czy zadanie zostało wykonane, ale także czy polityka firmy została naruszona w trakcie.
Trzydzieści konfiguracji modeli z jedenastu dostawców zostało ocenionych; a podczas testów każde zadanie powtórzono czterokrotnie w identycznych warunkach.
W przeciwieństwie do konwencjonalnych benchmarków, HANDBOOK.md oceniał zarówno wykonanie wymaganych działań, jak i unikanie zabronionych działań, pozwalając agentom niepowodzenie, pomimo ukończenia żądanego zadania.
Środowiska i narzędzia
Każde symulowane środowisko biurowe jest zaprojektowane do uruchomienia w standardowym środowisku Docker, umożliwiając każdemu modelowi dostęp do tego samego zestawu narzędzi, a jednocześnie uniemożliwiając różnice w dostępności oprogramowania wpływające na wyniki. Benchmark przedstawia agentom realistyczne środowisko biurowe, składające się z dostępu do plików, a także wcześniej wymienionych usług przedsiębiorstwa (tj. Gmail, Slack itp.):

Przybliżone przedstawienie środowiska biurowego, w którym muszą działać modele.
Środowiska również zachowują każde działanie wykonane przez agenta, umożliwiając systemowi oceny benchmarku ocenę całej sekwencji działań prowadzących do końcowego wyniku.
Metryki
Wydajność mierzona była przede wszystkim za pomocą ścisłego zaliczenia@1, w którym zadanie liczyło się jako udane tylko wtedy, gdy każdy kryterium oceny było spełnione. Jakiekolwiek pominięte wymaganie lub naruszenie polityki skutkowałoby niepowodzeniem, odzwierciedlając ustawienia przedsiębiorstwa, w którym jedno nieprawidłowe działanie może unieważnić inaczej kompetentny przepływ pracy.
Bardziej wyrozumiały wskaźnik, zaliczenie@1 (N−1), był również używany, w którym jeden nieudany kryterium był dozwolony na zadanie, aby można było odróżnić przypadki, w których zadanie było bliskie powodzenia, od całkowitego niepowodzenia.
Do dodatkowej analizy nagrano średni wynik każdego modelu na każde kryterium, chociaż nie był on używany w nagłówkowych rankingach benchmarku.
Ogólny podejście
Dziesięć podręczników bazowych zostało napisanych przez ekspertów i dostosowanych do prawdziwych polityk firmowych, po czym każdy został zmodyfikowany w wersje specyficzne dla zadań z różnymi łańcuchami zatwierdzeń, progami i procedurami. Następnie zbudowano realistyczne środowiska biurowe wokół każdego podręcznika, składające się z e-maili, kalendarzy, rozmów Slack, arkuszy kalkulacyjnych i innych artefaktów biurowych.
Każde zadanie zostało dopracowane za pomocą powtarzanych testów, aż kryteria oceny wiernie rozróżniały prawdziwe niepowodzenia modeli od wad samego benchmarku. Kryteria, które odrzucały prawidłowe zachowanie lub przyjmowały nieprawidłowe rozwiązania, zostały zmienione przed wydaniem.
Testy i wyniki
Nawet najbardziej zaawansowane modele nie powiodły się w większości zadań pod surowym systemem oceny benchmarku, a ich wyniki były rozproszone na szerokim zakresie, a nie skupione na samej górze:

Początkowy leaderboard rankingujący wszystkie 30 ocenianych konfiguracji modeli według ich ścisłych wyników zaliczenia@1 na benchmarku HANDBOOK.md. Wyniki reprezentują procent zadań benchmarku wykonanych bez jednego nieudanego kryterium oceny w czterech próbach na zadanie. Związane wyniki dzielą ten sam ranking.
Różnice między ustawieniami uzasadniania również okazały się znacznie różnić w zależności od modelu, a dodatkowe uzasadnianie czasem poprawiało wyniki; czasem nie robiło różnicy; a czasem obniżało je:
‘Wysiłek uzasadniania pomaga nierównomiernie. Zwiększony wysiłek poprawia wyniki Opus 4.8 (+3,0), Sonnet 4.6 (+2,7) i Fable 5 (+2,0), pozostawia GPT-5.5 bez zmian (21,5% w obu ustawieniach), a GLM 5.2 jest negatywny (−2,7). ‘
‘Dodatkowa deliberacja wydaje się przekształcać w zgodność z zasadami tylko wtedy, gdy podstawowe niepowodzenie jest niezauważonym wnioskiem, a nie przegapionym odczytem.’
Claude Fable 5 osiągnął najwyższy wynik na poziomie 36,2%; Claude Fable 5 zajął drugie miejsce z wynikiem 34,2%; a GPT-5.6 Sol (maks.) z wynikiem 23,5%. GPT-5.5 i Claude Opus 4.8 utworzyły następny poziom, na poziomie około 20%, podczas gdy większość pozostałych modeli frontierowych uzyskała wynik poniżej 16%. Najniżej sklasyfikowane modele ukończyły mniej niż 2% zadań.
Praca również zauważa zakres samozmyłowania, który charakteryzuje tak wiele podejść LLM:
‘Prawie każda nieudana trajektoria kończy się pewnym oświadczeniem, że podręcznik został przestrzegany, często cytując konkretnie te same sekcje, które zostały naruszone. Raporty są szczegółowe, dobrze ustrukturyzowane i błędne […]’
‘[…] W całym benchmarku samoraport agenta jest najmniej godnym zaufania artefaktem w trajektorii, co ma znaczenie dla każdego wdrożenia, które prezentuje podsumowania agenta ludziom jako dowód tego, co zostało zrobione.’
W podsumowaniu autorzy stwierdzają, że sam długi kontekst uzasadniania jest mało prawdopodobny, aby uczynić AI w przedsiębiorstwie wiernie przestrzegającą polityki firmy. Zamiast tego zgodność z polityką powinna być coraz częściej egzekwowana za pomocą deterministycznych kontroli zewnętrznych, wraz z barierami przepływu pracy.
Wnioski
Opinia Jednym z interesujących rozważań jest ostateczny zakres, w jakim środowiska takie jak te, które zostały stworzone do eksperymentów, zostaną przekształcone w celu ułatwienia AI, zamiast zmuszania LLM do interpretowania tych samych form i formatów, które definiują środowisko biurowe ludzi.
I ja również coraz częściej przyjmuję i dostosowuję się do wizualnych i tekstowych ograniczeń podczas rozmów z LLM, a także wybieram i akceptuję formaty plików, których normalnie bym nie wybrał, ponieważ lepiej odpowiadają one przepływowi pracy LLM.
Dlatego, chociaż jest zabawnie obserwować, jak modele frontierowe potykają się w świecie Davida Brenta, można się zastanawiać, czy to najbardziej prawdopodobny scenariusz dla ‘agentywnego pracownika biurowego’.
Pierwotnie opublikowane w środę, 29 lipca 2026. Zaktualizowane 18:41 EET, naprawiono złamany link.












