Andersons vinkel
AI kämpar för att respektera personalhandboken
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN.jpg)
En ny benchmark visar att AI-agenter på arbetsplatsen ignorerar företagsregler, utför förbjudna handlingar som obehöriga uppsägningar – och sedan rapporterar falskt att de följt reglerna.
En intressant ny forskningsstudie har placerat ledande LLM-modeller i positionen att följa instruktioner i en simulerad företagsmiljö, respektera alla bestämmelser i en tillhandahållen personalhandbok (skapad av humana experter), samt förhandla om konfliktfyllda eller förvirrande direktiv och uppdateringar från underordnade och chefer, och utföra uppgifter baserat på PDF:er, Jira-inlägg och andra vanliga plattformar och verktyg från en typisk mänsklig kontorsmiljö.
Om du någonsin har arbetat på ett kontor (eller åtminstone sett Office Space) kommer du att känna igen de motsägelsefulla signalerna och den förvirrande signal-till-brus-förhållandet som författarna till den nya studien utsatte språkmodellerna för:

Stormen av variabler som många kontorsarbetare måste hantera dagligen, destillerad till en virtuell miljö för att testa agenter med gränsöverskridande modeller. Källa
Den viktigaste utmaningen som även de ledande AI-systemen står inför här är behovet av att behålla den tillhandahållna personalhandboken som en filter för alla efterföljande kommandon. Om du någonsin har kämpat för att få ChatGPT eller Claude att komma ihåg instruktionerna du gav i början av en session, kommer du att veta att AI:s kontextfönster ofta gör att den glömmer tidigare kommandon och återgår till sitt standardbeteende.
Detta är varför Claude Fable 5, GPT-5.5 och andra ledande modeller i testerna avskedade anställda efter att ha tagit order från en chef som saknade behörighet; godkände fakturor utan den erforderliga chefens underskrift; accepterade utgångna laboratorieresultat som företagets policy uttryckligen avvisade; och sedan rapporterade att de hade följt handboken – bland många andra överträdelser av företagets policy.
Författarna till den nya studien skriver:
‘Misslyckanden följer konsekventa mönster: agenter låter en trovärdig begäran i miljön åsidosätta den fastställda policyn, utför en erforderlig kontroll och agerar sedan mot dess resultat, förlorar regeldetaljer över långa horisonter och rapporterar överensstämmelse som de inte uppnått.’
Misslyckandsanalysen innehåller några underhållande exempel: i en finansiell uppgift upptäckte Claude Opus 4.8 korrekt att en utgift på 7 500 dollar hade godkänts av samma junioranalytiker som lämnade in den, vilket strider mot företagets policy.
Det resonera sig själv till att tro att analytikern verkligen var finanschefen och godkände betalningen ändå:
‘Efter att ha befordrat honom till finanschef inom sin egen tankekedja, godkände modellen artikeln och skickade sedan ett meddelande till den riktiga finanschefen för att bekräfta att varje artikel över 5 000 dollar hade dokumenterad godkännande.
‘Misslyckandet är inte en saknad funktion; alla fakta som krävs för det korrekta beslutet hade hämtats av modellen själv.’

Hur Claude Opus 4.8 misslyckades med att försona 7 500 dollar.
På annat håll lämnade Gemini 3.5 Flash in försäkringshandlingar med hjälp av laboratorieresultat som redan hade gått ut utan att ens öppna laboratorierapporten, trots att insamlingsdatumet fanns i filnamnet:
‘Gemini 3.5 Flash lämnade in förhandsgodkännandet till försäkringsgivaren utan en enda läsning mot lab-PDF:en, och rapporterade sedan att den hade behandlat fallet “strikt enligt standardförfarandet”.’
Under hela benchmarken fann författarna också att många modeller påstod sig ha följt varje företagsregel, samtidigt som de citerade de very handboksavsnitt som de just hade överträtt.
Extra resonemang misslyckades ofta med att hjälpa; till exempel visade GPT-5.5 ingen förbättring med ökat resonemang, medan vissa modeller faktiskt presterade sämre, tydligen resonerade sig bort från det korrekta beslutet.
I de slutliga resultaten uppnådde Claude Fable 5 den högsta strikta godkännandegraden på 36,2%; GPT-5.6 Sol rankades som nummer två på 23,5%; och GPT-5.5 och Claude Opus 4.8 nådde var och en 21,5–21,9%.
De flesta av de återstående utvärderade modellerna fick under 16%, och de flesta gränsöverskridande konfigurationerna fick under 25% enligt benchmarkens strikta utvärderingskriterier:

Den bäst presterande AI-agenten slutförde bara över en tredjedel av benchmarkens policystyrda arbetsuppgifter, medan de flesta ledande modellerna misslyckades med mer än tre fjärdedelar under strikt utvärdering. Källa
Som en form av åtgärd förespråkar författarna att kritiska företagspolicys bör påtvingas utanför AI med hjälp av deterministiska verktygsanropsgarder (dvs. hårdkodade kontroller som blockerar förbjudna åtgärder), snarare än att enbart förlita sig på långkontextminne.
De förespråkar också att HANDBOOK.md ska användas som en standardiserad benchmark för att mäta och spåra förbättringar i långkontextpolicyefterlevnad, när framtida agenter utvecklas.
Den nya artikeln heter HANDBOOK.md: En benchmark för långkontextagenter som följer instruktioner, och kommer från sju författare på surge.ai. Artikeln åtföljs av ett GitHub-repo som innehåller Docker-filer och andra krav för att reproducera testerna.
Metod
Sextiofem simulerade kontorsmiljöer skapades för HANDBOOK.md-benchmarken, som omfattar ekonomi; HR; försäkring; logistik; och medicinsk fakturering; och var och en placerar en modell i en containeriserad företagsmiljö som innehåller filer, e-post, Slack-samtal, kalendrar, Jira-bräden och andra vanliga kontorsverktyg.
Varje uppgift styrdes av en handbok på mellan 20 och 124 sidor, som tillhandahölls som PDF-, Word- eller HTML-dokument, snarare än att infogas i prompten, vilket tvingade modellerna att hitta, läsa och tillämpa de relevanta reglerna under hela uppgiften.
Tio expertskrivna grundhandböcker anpassades från riktiga branschpolicys, varefter varje uppgift fick sin egen modifierade version med olika godkännandekedjor, trösklar och procedurregler, för att förhindra inlärning:
‘Experter skrev de tio grundhandböckerna genom att anpassa riktiga policys från sina branscher. Var och en är ett långt, flersektionsoperativt dokument snarare än en regellista.
‘En representativ HR-handbok innehåller 19 numrerade avsnitt: en översikt, definitioner, HR-teamet och kontakter, Slack-kanalkartan, referensfiler och system, begärandekategorier, triage- och dirigeringsregler, en prioriteringsmatris med SLA, procedurer för onboarding, offboarding, ledighet, prestation och rekrytering, eskaleringsvägar, e-posthygienregler och en samling av krävda mallar och standardformat’
Success mättes med 824 deterministiska Python-baserade verifikationskontroller, som omfattade både krävda åtgärder och förbjudna åtgärder – vilket möjliggjorde för benchmarken att upptäcka inte bara om en uppgift hade slutförts, utan också om företagets policy hade överträtts under resan.
Trettio modellkonfigurationer från elva leverantörer utvärderades; och under testerna upprepades varje uppgift fyra gånger under identiska förhållanden.
Till skillnad från konventionella benchmark-tester utvärderade HANDBOOK.md både om krävda åtgärder slutfördes och om förbjudna åtgärder undveks, vilket möjliggjorde för agenter att misslyckas, trots att de slutförde den begärda uppgiften
Miljöer och verktyg
Varje simulerad arbetsplats är utformad för att köras i en standardiserad Docker-miljö, vilket ger varje modell tillgång till samma uppsättning verktyg, samtidigt som det förhindrar att skillnader i programvarutillgänglighet påverkar resultaten. Benchmarken presenterar agenter med en realistisk kontorsmiljö, bestående av filåtkomst, tillsammans med de ovannämnda företagstjänsterna (dvs. Gmail, Slack etc.):

En ungefärlig representation av kontorsmiljön som modellerna måste operera inom.
Miljöerna bevarar också varje åtgärd som utförs av agenten, vilket möjliggör för benchmarkens deterministiska utvärderingssystem att bedöma den fullständiga sekvensen av åtgärder som leder till det slutliga resultatet.
Mätetal
Prestanda mättes främst med hjälp av strikt godkännande@1, där en uppgift räknades som lyckad endast om varje utvärderingskriterium var uppfyllt. Eventuella missade krav eller policyöverträdelser skulle resultera i misslyckande, vilket speglar företagsmiljöer, där en enda felaktig åtgärd kan ogiltigförklara en annars kompetent arbetsflöde.
En mer förlåtande mätning, godkännande@1 (N−1), användes också, där ett misslyckat kriterium tilläts per uppgift, så att nära-missar kunde särskiljas från fullständiga misslyckanden.
För ytterligare analys registrerades varje modells genomsnittliga poäng per kriterium, även om detta inte användes i benchmarkens huvudsakliga ranking.
Allmän tillvägagångssätt
Tio expertskrivna handböcker anpassades från riktiga företagspolicys, varefter var och en modifierades till flera uppgiftsspecifika versioner med olika godkännandekedjor, trösklar och procedurregler. Realistiska kontorsmiljöer byggdes sedan runt varje handbok, bestående av e-post, kalendrar, Slack-samtal, kalkylblad och andra arbetsplatsartefakter.
Varje uppgift raffinerades genom upprepade tester tills utvärderingskriterierna tillförlitligt skilde mellan verkliga modellmisslyckanden och brister i benchmarken i sig. Kriterier som avvisade korrekt beteende eller tillät felaktiga lösningar reviderades innan de släpptes.
Tester och resultat
Även de starkaste modellerna misslyckades med de flesta uppgifter under benchmarkens strikta betygsystem, med prestanda spridd över ett brett område, snarare än klusterat högst upp:

Det första resultatledarskapet som rankar alla 30 utvärderade modellkonfigurationer efter deras strikta godkännande@1-poäng på HANDBOOK.md-benchmarken. Poängen representerar procentandelen av benchmarkens 65 arbetsuppgifter som slutfördes utan ett enda misslyckat utvärderingskriterium över fyra försök per uppgift. Likvärdiga poäng delar på samma rank.
Skillnaderna mellan resonemangsinställningar varierade också avsevärt mellan modellerna, med extra resonemang som ibland förbättrade prestandan; ibland gjorde liten skillnad; och ibland minskade den:
‘[Resonemang] ansträngning hjälper ojämnt. Ökad ansträngning förbättrar Opus 4.8 (+3.0), Sonnet 4.6 (+2.7) och Fable 5 (+2.0), lämnar GPT-5.5 oförändrad (21,5% vid båda inställningarna) och skadar GLM 5.2 (−2.7). ‘
‘Ytterligare övervägande verkar omvandlas till regelöverensstämmelse endast när det underliggande misslyckandet är ett missat slutledningsfel snarare än ett missat [läs].’
Claude Fable 5 uppnådde den högsta poängen på 36,2%; följt av Claude Fable 5 på 34,2%; och GPT-5.6 Sol (max) på 23,5%. GPT-5.5 och Claude Opus 4.8 bildade den nästa nivån, runt 20%, medan de flesta återstående gränsöverskridande modellerna fick under 16%. De lägst rankade modellerna slutförde färre än 2% av uppgifterna.
Den detaljerade misslyckandsanalysen i artikeln tyder på att problemet ofta inte var brist på information, eftersom relevanta handboksregler och stödbevis redan hade hämtats – men extra resonemang kunde ibland orsaka att modellerna övergav det korrekta slutsatserna till förmån för en trovärdig men policyöverträdande.
Arbetet noterar också omfattningen av självbedrägeri som kännetecknar så många av LLM:ernas företag:
‘Nästan varje misslyckad bana slutar med en självsäker förklaring att handboken följdes, ofta med hänvisning till de specifika avsnitt som överträtts. Rapporterna är detaljerade, välstrukturerade och felaktiga […]
‘[…] Under hela benchmarken är agentens självrapport den minst tillförlitliga artefakten i banan, vilket är viktigt för alla distributioner som visar agentsummeringar för människor som bevis för vad som gjordes.’
I slutet av artikeln drar författarna slutsatsen att långkontextresonemang ensamt är osannolikt att göra företags-AI tillförlitligt följa företagets policy. Istället bör policyefterlevnad alltmer påtvingas genom deterministiska yttre kontroller, utöver arbetsflödes räcken.
Slutsats
Åsikt En intressant övervägning är den till sist hur långt miljöer som de som skapats för experimenten kommer att omgestaltas för att underlätta AI, snarare än att tvinga LLM:er att tolka samma former och format som definierar mänskliga kontorsmiljöer. Till exempel skickade en affärskontakt mig igår för första gången en .md-översikt som är avsedd att utforskas av en LLM, snarare än att läsas i en linjär form.
Och jag anpassar mig också alltmer till de visuella och textbaserade begränsningarna under LLM-samtal, samt väljer och accepterar filformat som jag normalt inte skulle välja, eftersom de underlättar LLM-arbetsflödet mer skickligt.
Därför är det underhållande att se gränsöverskridande modeller snubbla runt i David Brents värld, men man undrar om detta är den mest sannolika scenariot för “agenten på kontoret”.
Publicerad onsdag, 29 juli 2026. Uppdaterad 18:41 EET, fixade trasig länk.












