Andersons vinkel

AI-kæmper for at respektere medarbejderhåndbogen

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

En ny benchmark viser, at arbejdspladsens AI-agenter ignorerer virksomhedens regler, udfører forbudte handlinger såsom uautoriserede fyringer – og derefter rapporterer falsk, at de har overholdt reglerne.

 

En interessant ny forskningsstudie har placeret førende LLM-modeller i situationen, hvor de skal følge instruktioner i en simuleret virksomhed, respektere alle punkter i en leveret medarbejderhåndbog (udarbejdet af menneskelige domæneeksperter), samt forhandle med strømme af modstridende eller forvirrende direktiver og opdateringer fra underordnede og overordnede, og udføre opgaver baseret på PDF’er, Jira-poster og andre velkendte platforme og værktøjer fra en typisk menneskelig kontorsituation.

Hvis du nogensinde har arbejdet på en kontor (eller i hvert fald set Office Space), vil du genkende de modstridende signaler og den forvirrende signal-støjforhold, som forfatterne af den nye studie kastede over på sprogmodellerne:

Stormen af variable, som mange kontorarbejdere må kæmpe med dagligt, destilleret til en virtuel omgang for at teste agente frontier-modeller. Kilde - https://surgehq.ai/blog/handbook-md

Stormen af variable, som mange kontorarbejdere må kæmpe med dagligt, destilleret til en virtuel omgang for at teste agente frontier-modeller. Kilde

Nøgleudfordringen, som selv de førende AI-systemer står overfor her, er behovet for at fastholde den leverede medarbejderrelationsmanual som en filter for alle efterfølgende kommandoer. Hvis du nogensinde har kæmpet for at få ChatGPT eller Claude til at huske instruktionerne, du gav i starten af en session, vil du vide, at AI’ens kontekstvindue ofte gør, at den glemmer tidligere prompts og returnerer konstant til sin standardadfærd.

Dette er hvorfor, i tests, Claude Fable 5, GPT-5.5 og andre førende modeller fyrede ansatte efter at have modtaget ordrer fra en direktør, der manglede autoritet; godkendte fakturaer uden den nødvendige manager-godkendelse; accepterede udløbede laboratorie-resultater, som virksomhedens politik utvetydigt afviste; og derefter rapporterede, at de havde følt medarbejderhåndbogen – blandt mange andre overtrædelser af virksomhedens politik.

Forfatterne af den nye studie skriver:

‘Fejl følger konsistente mønstre: agenter lader en plausibel anmodning i miljøet overtage den fastsatte politik, udfører en nødvendig check og handler derefter imod dens resultat, mister regel detaljer over lange horisonter, og rapporterer overholdelse, de ikke opnåede.’

Fejlanalyserne indeholder nogle underholdende eksempler: I en finansopgave opdagede Claude Opus 4.8 korrekt, at en udgift på 7.500 dollars var godkendt af samme junioranalytiker, der indsendte den, i strid med virksomhedens politik.

Derefter begrundede den selv, at analytiker var den faktiske finanskontroller og godkendte betalingen alligevel:

‘Efter at have forfremmet ham til kontroller i sin egen tankekedde, godkendte modellen posten og meddelte derefter den rigtige kontroller, at hver post over 5.000 dollars havde dokumenteret godkendelse.

‘Fejlen er ikke en manglende evne; hver enkelt faktum, der kræves for den korrekte beslutning, var blevet hentet af modellen selv.’

Hvordan Claude Opus 4.8 ikke kunne forlige 7.500 dollars. Kilde - https://surgehq.ai/blog/handbook-md

Hvordan Claude Opus 4.8 ikke kunne forlige 7.500 dollars.

Andetsteds indsendte Gemini 3.5 Flash forsikringsdokumenter ved hjælp af laboratorie-resultater, der allerede var udløbet, uden så meget som at åbne laboratorie-rapporten, på trods af at samlingen af datoer fremgik af filnavnet i sig selv:

‘Gemini 3.5 Flash indsendte forudgodkendelsen til forsikringsselskabet uden en enkelt læseanmodning mod laboratorie-PDF’en, og rapporterede derefter, at den havde behandlet sagen “strengt ifølge standardprocedurer”.’

På tværs af benchmarket fandt forfatterne også, at mange modeller påtog sig, at de havde overholdt hver enkelt virksomhedsregel, mens de citerede de meget håndbogsafsnit, de lige havde overtrådt.

Ekstra begrundelse mislykkedes ofte; for eksempel viste GPT-5.5 ingen forbedring med øget begrundelsesindsats, mens nogle modeller faktisk opførte sig værre, åbenbart begrundende sig væk fra den korrekte beslutning.

I de endelige resultater opnåede Claude Fable 5 den højeste strikte bestå-procent på 36,2%; GPT-5.6 Sol rangerede som nummer to med 23,5%; og GPT-5.5 og Claude Opus 4.8 scorede hver 21,5–21,9%.

De fleste af de resterende vurderede modeller scorede under 16%, og de fleste frontier-konfigurationer scorede under 25% under benchmarkets strenge vurderingskriterier:

Den bedst performende AI-agent fuldførte kun lidt over en tredjedel af benchmarkets policy-styrede arbejdspladsopgaver, mens de fleste førende modeller fejlede mere end tre fjerdedele under streng vurdering. Kilde - https://cdn.prod.website-files.com/68dcd2ceb173c46fa029931c/6a3d6dad2852b9a91757a83e_leaderboard.png

Den bedst performende AI-agent fuldførte kun lidt over en tredjedel af benchmarkets policy-styrede arbejdspladsopgaver, mens de fleste førende modeller fejlede mere end tre fjerdedele under streng vurdering. Kilde

Som en form for remediation argumenterer forfatterne for, at kritiske virksomhedsregler skal gennemføres uden for AI ved hjælp af deterministiske værktøj-guards (dvs. hardkodede kontroller, der blokerer forbudte handlinger), snarere end at stole kun på lang-kontekst hukommelse alene.

De foreslår også at bruge HANDBOOK.md selv som en standardiseret benchmark til at måle og spore forbedringer i lang-kontekst policy-overholdelse, da fremtidige agente modeller udvikles.

Den nye artikel har titlen HANDBOOK.md: En benchmark for lang-kontekst agentic instruktionsfølgen og kommer fra syv forfattere på surge.ai. Artiklen ledsages af en GitHub-repository, der indeholder docker-filer og andre krævede filer til at reproducere testene.

Metode

Femogtres simulerede kontorscenarioer blev oprettet til HANDBOOK.md-benchmarket, der omfatter finans; HR; forsikring; logistik; og medicinsk fakturering; og hver placerer en model inden for en containeriseret virksomhedsomgang, der indeholder filer, e-mails, Slack-samtaler, kalendere, Jira-boards og andre velkendte kontorværktøjer.

Hver opgave blev styret af en håndbog på mellem 20 og 124 sider, leveret som PDF-, Word- eller HTML-dokumenter, snarere end indlejret i prompten, hvilket tvang modellerne til at finde, læse og anvende de relevante regler på tværs af opgaven.

Ti ekspertskrevne grundlæggende håndbøger blev tilpasset fra virkelige branchepolitikker, hvorefter hver opgave fik sin egen modificerede version med forskellige godkendelsesmyndigheder, grænser og procedurer, for at forhindre hukommelse:

‘Domæneeksperter skrev de ti grundlæggende håndbøger ved at tilpasse virkelige politikker fra deres brancher. Hver er et langt, multi-sektions driftsdokument snarere end en regelliste.

‘En repræsentant for en HR-håndbog indeholder 19 nummererede sektioner: en oversigt, definitioner, HR-holdet og kontakter, Slack-kanal-kort, referencefiler og systemer, anmodningstaksonomier, triage- og routingsregler, en prioriteringsmatrix med SLA’er, procedurer for onboarding, offboarding, orlov, præstation og rekruttering, eskalationsveje, e-mail-huskeleregler og en samling af krævede skabeloner og standardformater’

Succes blev målt med 824 deterministiske Python-baserede verificeringskontroller, der dækkede både krævede handlinger og forbudte handlinger – hvilket gjorde det muligt for benchmarket at registrere ikke kun, om en opgave var fuldført, men også, om virksomhedspolitikken var blevet overtrådt undervejs.

Tredive modelkonfigurationer fra 11 udbydere blev vurderet; og under tests gentog hver opgave fire gange under identiske betingelser.

I modsætning til konventionelle benchmarkets, vurderede HANDBOOK.md både, om krævede handlinger var fuldført, og om forbudte handlinger var undgået, hvilket gjorde det muligt for agenter at fejle, på trods af at de havde fuldført den anmodede opgave

Miljøer og værktøjer

Hver simuleret arbejdsplads er designet til at køre inden for en standardiseret Docker-miljø, hvilket giver hver model adgang til samme sæt af værktøjer, mens det forhindrer forskelle i softwaretilgængelighed fra at påvirke resultaterne. Benchmarket præsenterer agenterne med en realistisk kontormiljø, bestående af filadgang samt de ovennævnte virksomhedsservices (dvs. Gmail, Slack osv.):

En grov repræsentation af kontormiljøet, som modellerne skal operere i.

En grov repræsentation af kontormiljøet, som modellerne skal operere i.

Miljøerne bevarer også hver handling, der udføres af agenten, hvilket giver benchmarkets deterministiske vurderingssystem mulighed for at evaluere den komplette sekvens af handlinger, der fører til den endelige udfald.

Målinger

Præstationen blev primært målt ved hjælp af strengt bestå@1, hvor en opgave kun blev betragtet som fuldført, hvis hver vurderingskriterium var opfyldt. Enhver manglende krav eller politikovertrædelse ville resultere i fejl, hvilket afspejler virksomhedsindstillinger, hvor en enkelt forkert handling kan ugyldiggøre en ellers kompetent arbejdsgang.

En mere tilgivende måling, bestå@1 (N−1), blev også brugt, hvor en fejlet kriterium var tilladt per opgave, så nær-misser kunne adskilles fra komplette fejl.

Til yderligere analyse blev hver models gennemsnitlige score per kriterium optaget, selvom dette ikke blev brugt i benchmarkets overskrifts-rangering.

Generel tilgang

Ti ekspertskrevne håndbøger blev tilpasset fra virkelige virksomhedspolitikker, hvorefter hver blev modificeret til multiple opgave-specifikke versioner med forskellige godkendelses-kæder, grænser og procedurer. Realistiske kontormiljøer blev derefter bygget op omkring hver håndbog, bestående af e-mails, kalendere, Slack-samtaler, regneark og andre kontor-genstande.

Hver opgave blev forfinet gennem gentagen testning, indtil vurderingskriterierne pålideligt adskilte ægte model-fejl fra fejl i benchmarket selv. Kriterier, der afviste korrekt adfærd eller tillod forkerte løsninger, blev revideret, før de blev frigivet.

Tests og resultater

Selv de stærkeste modeller fejlede de fleste opgaver under benchmarkets strenge vurderingssystem, med en præstation, der var spredt over et bredt område, snarere end at klumpe sammen øverst:

Den initiale resultats-rangering af alle 30 vurderede modelkonfigurationer efter deres strenge bestå@1-scores på HANDBOOK.md-benchmarket. Scores repræsenterer procentdelen af benchmarkets 65 arbejdspladsopgaver, der blev fuldført uden en enkelt fejlet vurderingskriterium på tværs af fire forsøg per opgave. Lige scores deler samme rang.

Den initiale resultats-rangering af alle 30 vurderede modelkonfigurationer efter deres strenge bestå@1-scores på HANDBOOK.md-benchmarket. Scores repræsenterer procentdelen af benchmarkets 65 arbejdspladsopgaver, der blev fuldført uden en enkelt fejlet vurderingskriterium på tværs af fire forsøg per opgave. Lige scores deler samme rang.

Forskelle mellem begrundelsesindstillinger var også fundet at variere betydeligt afhængigt af model; med yderligere begrundelse, der nogle gange forbedrede præstationen; nogle gange gjorde lidt forskel; og nogle gange reducerede den:

‘[Begrundelses]indsats hjælper urent. Øget indsats forbedrer Opus 4.8 (+3.0), Sonnet 4.6 (+2.7) og Fable 5 (+2.0), efterlader GPT-5.5 uændret (21.5% i begge indstillinger) og skader GLM 5.2 (−2.7).

‘Yderligere overvejelse synes at omdanne til regel-overholdelse kun, når den underliggende fejl er en missede inferens snarere end en missede [læs].’

Claude Fable 5 opnåede den højeste score på 36,2%, efterfulgt af Claude Fable 5 på 34,2% og GPT-5.6 Sol (max) på 23,5%. GPT-5.5 og Claude Opus 4.8 dannede den næste trin, på omkring 20%, mens de fleste resterende frontier-modeller scorede under 16%. De lavest-rangerede modeller fuldførte færre end 2% af opgaverne.

Artiklens detaljerede fejl-analyse foreslår, at problemet ofte ikke var en mangel på information, da relevante håndbogsregler og understøttende beviser ofte allerede var blevet hentet – men yderligere begrundelse ville nogle gange få modellerne til at opgive den korrekte konklusion til fordel for en plausibel, men politik-overtrædende en.

Arbejdet bemærker også omfang af selvbedrag, der kendetegner så mange af LLM’ernes forsøg:

‘Næsten hver fejlet bane ender med en selvbevidst erklæring om, at håndbogen blev fulgt, ofte citerende de specifikke afsnit, der blev overtrådt. Rapporterne er detaljerede, velstrukturerede og forkerte […]

‘ […] På tværs af benchmarket er agentens selv-rapport den mindst pålidelige genstand i banen, hvilket har betydning for enhver udvikling, der viser agent-sammenfattende til mennesker som bevis for, hvad der blev gjort.’

I slutningen konkluderer forfatterne, at lang-kontekst begrundelse alene er usandsynligt at gøre virksomheds-AI pålideligt følge virksomhedspolitik. I stedet bør politik-overholdelse i stigende grad gennemføres gennem deterministiske eksterne kontroller, samt arbejdsgangs-sikkerhedsforanstaltninger.

Konklusion

Mening En interessant overvejelse er den eventuelle udstrækning, hvori miljøer som dem, der er oprettet til eksperimenterne, vil blive genopfundet for at lette AI, snarere end at tvinge LLM’er til at fortolke de samme former og formater, der definerer menneskelige kontormiljøer. For eksempel sendte en forretningskontakt i går for første gang en .md-oversigt, der var designet til at blive udforsket af en LLM, snarere end at blive læst i en lineær fremstilling.

Og jeg er også mere og mere begyndt at tilpasse og tilrette mig til de visuelle og tekstuelle begrænsninger under LLM-samtaler, samt vælge og acceptere filformater, som jeg normalt ikke ville vælge, fordi de tilgodeser LLM-arbejdsgangen mere behændigt.

Derfor, mens det er underholdende at se frontier-modellerne vakle rundt i David Brents verden, kan man undre sig over, om dette er den mest sandsynlige scenario for den ‘agente kontorarbejder’.

 

Offentliggjort onsdag, 29. juli 2026. Opdateret 18:41 EET, repareret brudt link.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai