Andersons vinkel

AI kÃĪmpar fÃķr att respektera personalhandboken

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

En ny benchmark visar att AI-agenter pÃĨ arbetsplatsen ignorerar fÃķretagsregler, utfÃķr fÃķrbjudna handlingar som obehÃķriga uppsÃĪgningar – och sedan rapporterar falskt att de fÃķljt reglerna.

 

En intressant ny forskningsstudie har placerat ledande LLM-modeller i positionen att fÃķlja instruktioner i en simulerad fÃķretagsmiljÃķ, respektera alla bestÃĪmmelser i en tillhandahÃĨllen personalhandbok (skapad av humana experter), samt fÃķrhandla om konfliktfyllda eller fÃķrvirrande direktiv och uppdateringar frÃĨn underordnade och chefer, och utfÃķra uppgifter baserat pÃĨ PDF:er, Jira-inlÃĪgg och andra vanliga plattformar och verktyg frÃĨn en typisk mÃĪnsklig kontorsmiljÃķ.

Om du nÃĨgonsin har arbetat pÃĨ ett kontor (eller ÃĨtminstone sett Office Space) kommer du att kÃĪnna igen de motsÃĪgelsefulla signalerna och den fÃķrvirrande signal-till-brus-fÃķrhÃĨllandet som fÃķrfattarna till den nya studien utsatte sprÃĨkmodellerna fÃķr:

Stormen av variabler som mÃĨnga kontorsarbetare mÃĨste hantera dagligen, destillerad till en virtuell miljÃķ fÃķr att testa agenter med grÃĪnsÃķverskridande modeller. KÃĪlla - https://surgehq.ai/blog/handbook-md

Stormen av variabler som mÃĨnga kontorsarbetare mÃĨste hantera dagligen, destillerad till en virtuell miljÃķ fÃķr att testa agenter med grÃĪnsÃķverskridande modeller. KÃĪlla

Den viktigaste utmaningen som ÃĪven de ledande AI-systemen stÃĨr infÃķr hÃĪr ÃĪr behovet av att behÃĨlla den tillhandahÃĨllna personalhandboken som en filter fÃķr alla efterfÃķljande kommandon. Om du nÃĨgonsin har kÃĪmpat fÃķr att fÃĨ ChatGPT eller Claude att komma ihÃĨg instruktionerna du gav i bÃķrjan av en session, kommer du att veta att AI:s kontextfÃķnster ofta gÃķr att den glÃķmmer tidigare kommandon och ÃĨtergÃĨr till sitt standardbeteende.

Detta ÃĪr varfÃķr Claude Fable 5, GPT-5.5 och andra ledande modeller i testerna avskedade anstÃĪllda efter att ha tagit order frÃĨn en chef som saknade behÃķrighet; godkÃĪnde fakturor utan den erforderliga chefens underskrift; accepterade utgÃĨngna laboratorieresultat som fÃķretagets policy uttryckligen avvisade; och sedan rapporterade att de hade fÃķljt handboken – bland mÃĨnga andra ÃķvertrÃĪdelser av fÃķretagets policy.

FÃķrfattarna till den nya studien skriver:

‘Misslyckanden fÃķljer konsekventa mÃķnster: agenter lÃĨter en trovÃĪrdig begÃĪran i miljÃķn ÃĨsidosÃĪtta den faststÃĪllda policyn, utfÃķr en erforderlig kontroll och agerar sedan mot dess resultat, fÃķrlorar regeldetaljer Ãķver lÃĨnga horisonter och rapporterar ÃķverensstÃĪmmelse som de inte uppnÃĨtt.’

Misslyckandsanalysen innehÃĨller nÃĨgra underhÃĨllande exempel: i en finansiell uppgift upptÃĪckte Claude Opus 4.8 korrekt att en utgift pÃĨ 7 500 dollar hade godkÃĪnts av samma junioranalytiker som lÃĪmnade in den, vilket strider mot fÃķretagets policy.

Det resonera sig sjÃĪlv till att tro att analytikern verkligen var finanschefen och godkÃĪnde betalningen ÃĪndÃĨ:

‘Efter att ha befordrat honom till finanschef inom sin egen tankekedja, godkÃĪnde modellen artikeln och skickade sedan ett meddelande till den riktiga finanschefen fÃķr att bekrÃĪfta att varje artikel Ãķver 5 000 dollar hade dokumenterad godkÃĪnnande.

‘Misslyckandet ÃĪr inte en saknad funktion; alla fakta som krÃĪvs fÃķr det korrekta beslutet hade hÃĪmtats av modellen sjÃĪlv.’

Hur Claude Opus 4.8 misslyckades med att fÃķrsona 7 500 dollar. KÃĪlla - https://surgehq.ai/blog/handbook-md

Hur Claude Opus 4.8 misslyckades med att fÃķrsona 7 500 dollar.

PÃĨ annat hÃĨll lÃĪmnade Gemini 3.5 Flash in fÃķrsÃĪkringshandlingar med hjÃĪlp av laboratorieresultat som redan hade gÃĨtt ut utan att ens Ãķppna laboratorierapporten, trots att insamlingsdatumet fanns i filnamnet:

‘Gemini 3.5 Flash lÃĪmnade in fÃķrhandsgodkÃĪnnandet till fÃķrsÃĪkringsgivaren utan en enda lÃĪsning mot lab-PDF:en, och rapporterade sedan att den hade behandlat fallet “strikt enligt standardfÃķrfarandet”.’

Under hela benchmarken fann fÃķrfattarna ocksÃĨ att mÃĨnga modeller pÃĨstod sig ha fÃķljt varje fÃķretagsregel, samtidigt som de citerade de very handboksavsnitt som de just hade ÃķvertrÃĪtt.

Extra resonemang misslyckades ofta med att hjÃĪlpa; till exempel visade GPT-5.5 ingen fÃķrbÃĪttring med Ãķkat resonemang, medan vissa modeller faktiskt presterade sÃĪmre, tydligen resonerade sig bort frÃĨn det korrekta beslutet.

I de slutliga resultaten uppnÃĨdde Claude Fable 5 den hÃķgsta strikta godkÃĪnnandegraden pÃĨ 36,2%; GPT-5.6 Sol rankades som nummer tvÃĨ pÃĨ 23,5%; och GPT-5.5 och Claude Opus 4.8 nÃĨdde var och en 21,5–21,9%.

De flesta av de ÃĨterstÃĨende utvÃĪrderade modellerna fick under 16%, och de flesta grÃĪnsÃķverskridande konfigurationerna fick under 25% enligt benchmarkens strikta utvÃĪrderingskriterier:

Den bÃĪst presterande AI-agenten slutfÃķrde bara Ãķver en tredjedel av benchmarkens policystyrda arbetsuppgifter, medan de flesta ledande modellerna misslyckades med mer ÃĪn tre fjÃĪrdedelar under strikt utvÃĪrdering. KÃĪlla - https://cdn.prod.website-files.com/68dcd2ceb173c46fa029931c/6a3d6dad2852b9a91757a83e_leaderboard.png

Den bÃĪst presterande AI-agenten slutfÃķrde bara Ãķver en tredjedel av benchmarkens policystyrda arbetsuppgifter, medan de flesta ledande modellerna misslyckades med mer ÃĪn tre fjÃĪrdedelar under strikt utvÃĪrdering. KÃĪlla

Som en form av ÃĨtgÃĪrd fÃķresprÃĨkar fÃķrfattarna att kritiska fÃķretagspolicys bÃķr pÃĨtvingas utanfÃķr AI med hjÃĪlp av deterministiska verktygsanropsgarder (dvs. hÃĨrdkodade kontroller som blockerar fÃķrbjudna ÃĨtgÃĪrder), snarare ÃĪn att enbart fÃķrlita sig pÃĨ lÃĨngkontextminne.

De fÃķresprÃĨkar ocksÃĨ att HANDBOOK.md ska anvÃĪndas som en standardiserad benchmark fÃķr att mÃĪta och spÃĨra fÃķrbÃĪttringar i lÃĨngkontextpolicyefterlevnad, nÃĪr framtida agenter utvecklas.

Den nya artikeln heter HANDBOOK.md: En benchmark fÃķr lÃĨngkontextagenter som fÃķljer instruktioner, och kommer frÃĨn sju fÃķrfattare pÃĨ surge.ai. Artikeln ÃĨtfÃķljs av ett GitHub-repo som innehÃĨller Docker-filer och andra krav fÃķr att reproducera testerna.

Metod

Sextiofem simulerade kontorsmiljÃķer skapades fÃķr HANDBOOK.md-benchmarken, som omfattar ekonomi; HR; fÃķrsÃĪkring; logistik; och medicinsk fakturering; och var och en placerar en modell i en containeriserad fÃķretagsmiljÃķ som innehÃĨller filer, e-post, Slack-samtal, kalendrar, Jira-brÃĪden och andra vanliga kontorsverktyg.

Varje uppgift styrdes av en handbok pÃĨ mellan 20 och 124 sidor, som tillhandahÃķlls som PDF-, Word- eller HTML-dokument, snarare ÃĪn att infogas i prompten, vilket tvingade modellerna att hitta, lÃĪsa och tillÃĪmpa de relevanta reglerna under hela uppgiften.

Tio expertskrivna grundhandbÃķcker anpassades frÃĨn riktiga branschpolicys, varefter varje uppgift fick sin egen modifierade version med olika godkÃĪnnandekedjor, trÃķsklar och procedurregler, fÃķr att fÃķrhindra inlÃĪrning:

‘Experter skrev de tio grundhandbÃķckerna genom att anpassa riktiga policys frÃĨn sina branscher. Var och en ÃĪr ett lÃĨngt, flersektionsoperativt dokument snarare ÃĪn en regellista.

‘En representativ HR-handbok innehÃĨller 19 numrerade avsnitt: en Ãķversikt, definitioner, HR-teamet och kontakter, Slack-kanalkartan, referensfiler och system, begÃĪrandekategorier, triage- och dirigeringsregler, en prioriteringsmatris med SLA, procedurer fÃķr onboarding, offboarding, ledighet, prestation och rekrytering, eskaleringsvÃĪgar, e-posthygienregler och en samling av krÃĪvda mallar och standardformat’

Success mÃĪttes med 824 deterministiska Python-baserade verifikationskontroller, som omfattade bÃĨde krÃĪvda ÃĨtgÃĪrder och fÃķrbjudna ÃĨtgÃĪrder – vilket mÃķjliggjorde fÃķr benchmarken att upptÃĪcka inte bara om en uppgift hade slutfÃķrts, utan ocksÃĨ om fÃķretagets policy hade ÃķvertrÃĪtts under resan.

Trettio modellkonfigurationer frÃĨn elva leverantÃķrer utvÃĪrderades; och under testerna upprepades varje uppgift fyra gÃĨnger under identiska fÃķrhÃĨllanden.

Till skillnad frÃĨn konventionella benchmark-tester utvÃĪrderade HANDBOOK.md bÃĨde om krÃĪvda ÃĨtgÃĪrder slutfÃķrdes och om fÃķrbjudna ÃĨtgÃĪrder undveks, vilket mÃķjliggjorde fÃķr agenter att misslyckas, trots att de slutfÃķrde den begÃĪrda uppgiften

MiljÃķer och verktyg

Varje simulerad arbetsplats ÃĪr utformad fÃķr att kÃķras i en standardiserad Docker-miljÃķ, vilket ger varje modell tillgÃĨng till samma uppsÃĪttning verktyg, samtidigt som det fÃķrhindrar att skillnader i programvarutillgÃĪnglighet pÃĨverkar resultaten. Benchmarken presenterar agenter med en realistisk kontorsmiljÃķ, bestÃĨende av filÃĨtkomst, tillsammans med de ovannÃĪmnda fÃķretagstjÃĪnsterna (dvs. Gmail, Slack etc.):

En ungefÃĪrlig representation av kontorsmiljÃķn som modellerna mÃĨste operera inom.

En ungefÃĪrlig representation av kontorsmiljÃķn som modellerna mÃĨste operera inom.

MiljÃķerna bevarar ocksÃĨ varje ÃĨtgÃĪrd som utfÃķrs av agenten, vilket mÃķjliggÃķr fÃķr benchmarkens deterministiska utvÃĪrderingssystem att bedÃķma den fullstÃĪndiga sekvensen av ÃĨtgÃĪrder som leder till det slutliga resultatet.

MÃĪtetal

Prestanda mÃĪttes frÃĪmst med hjÃĪlp av strikt godkÃĪnnande@1, dÃĪr en uppgift rÃĪknades som lyckad endast om varje utvÃĪrderingskriterium var uppfyllt. Eventuella missade krav eller policyÃķvertrÃĪdelser skulle resultera i misslyckande, vilket speglar fÃķretagsmiljÃķer, dÃĪr en enda felaktig ÃĨtgÃĪrd kan ogiltigfÃķrklara en annars kompetent arbetsflÃķde.

En mer fÃķrlÃĨtande mÃĪtning, godkÃĪnnande@1 (N−1), anvÃĪndes ocksÃĨ, dÃĪr ett misslyckat kriterium tillÃĪts per uppgift, sÃĨ att nÃĪra-missar kunde sÃĪrskiljas frÃĨn fullstÃĪndiga misslyckanden.

FÃķr ytterligare analys registrerades varje modells genomsnittliga poÃĪng per kriterium, ÃĪven om detta inte anvÃĪndes i benchmarkens huvudsakliga ranking.

AllmÃĪn tillvÃĪgagÃĨngssÃĪtt

Tio expertskrivna handbÃķcker anpassades frÃĨn riktiga fÃķretagspolicys, varefter var och en modifierades till flera uppgiftsspecifika versioner med olika godkÃĪnnandekedjor, trÃķsklar och procedurregler. Realistiska kontorsmiljÃķer byggdes sedan runt varje handbok, bestÃĨende av e-post, kalendrar, Slack-samtal, kalkylblad och andra arbetsplatsartefakter.

Varje uppgift raffinerades genom upprepade tester tills utvÃĪrderingskriterierna tillfÃķrlitligt skilde mellan verkliga modellmisslyckanden och brister i benchmarken i sig. Kriterier som avvisade korrekt beteende eller tillÃĪt felaktiga lÃķsningar reviderades innan de slÃĪpptes.

Tester och resultat

Även de starkaste modellerna misslyckades med de flesta uppgifter under benchmarkens strikta betygsystem, med prestanda spridd Ãķver ett brett omrÃĨde, snarare ÃĪn klusterat hÃķgst upp:

Det fÃķrsta resultatledarskapet som rankar alla 30 utvÃĪrderade modellkonfigurationer efter deras strikta godkÃĪnnande@1-poÃĪng pÃĨ HANDBOOK.md-benchmarken. PoÃĪngen representerar procentandelen av benchmarkens 65 arbetsuppgifter som slutfÃķrdes utan ett enda misslyckat utvÃĪrderingskriterium Ãķver fyra fÃķrsÃķk per uppgift. LikvÃĪrdiga poÃĪng delar pÃĨ samma rank.

Det fÃķrsta resultatledarskapet som rankar alla 30 utvÃĪrderade modellkonfigurationer efter deras strikta godkÃĪnnande@1-poÃĪng pÃĨ HANDBOOK.md-benchmarken. PoÃĪngen representerar procentandelen av benchmarkens 65 arbetsuppgifter som slutfÃķrdes utan ett enda misslyckat utvÃĪrderingskriterium Ãķver fyra fÃķrsÃķk per uppgift. LikvÃĪrdiga poÃĪng delar pÃĨ samma rank.

Skillnaderna mellan resonemangsinstÃĪllningar varierade ocksÃĨ avsevÃĪrt mellan modellerna, med extra resonemang som ibland fÃķrbÃĪttrade prestandan; ibland gjorde liten skillnad; och ibland minskade den:

‘[Resonemang] anstrÃĪngning hjÃĪlper ojÃĪmnt. Ökad anstrÃĪngning fÃķrbÃĪttrar Opus 4.8 (+3.0), Sonnet 4.6 (+2.7) och Fable 5 (+2.0), lÃĪmnar GPT-5.5 ofÃķrÃĪndrad (21,5% vid bÃĨda instÃĪllningarna) och skadar GLM 5.2 (−2.7). ‘

‘Ytterligare ÃķvervÃĪgande verkar omvandlas till regelÃķverensstÃĪmmelse endast nÃĪr det underliggande misslyckandet ÃĪr ett missat slutledningsfel snarare ÃĪn ett missat [lÃĪs].’

Claude Fable 5 uppnÃĨdde den hÃķgsta poÃĪngen pÃĨ 36,2%; fÃķljt av Claude Fable 5 pÃĨ 34,2%; och GPT-5.6 Sol (max) pÃĨ 23,5%. GPT-5.5 och Claude Opus 4.8 bildade den nÃĪsta nivÃĨn, runt 20%, medan de flesta ÃĨterstÃĨende grÃĪnsÃķverskridande modellerna fick under 16%. De lÃĪgst rankade modellerna slutfÃķrde fÃĪrre ÃĪn 2% av uppgifterna.

Den detaljerade misslyckandsanalysen i artikeln tyder pÃĨ att problemet ofta inte var brist pÃĨ information, eftersom relevanta handboksregler och stÃķdbevis redan hade hÃĪmtats – men extra resonemang kunde ibland orsaka att modellerna Ãķvergav det korrekta slutsatserna till fÃķrmÃĨn fÃķr en trovÃĪrdig men policyÃķvertrÃĪdande.

Arbetet noterar ocksÃĨ omfattningen av sjÃĪlvbedrÃĪgeri som kÃĪnnetecknar sÃĨ mÃĨnga av LLM:ernas fÃķretag:

‘NÃĪstan varje misslyckad bana slutar med en sjÃĪlvsÃĪker fÃķrklaring att handboken fÃķljdes, ofta med hÃĪnvisning till de specifika avsnitt som ÃķvertrÃĪtts. Rapporterna ÃĪr detaljerade, vÃĪlstrukturerade och felaktiga [â€Ķ]

‘[â€Ķ] Under hela benchmarken ÃĪr agentens sjÃĪlvrapport den minst tillfÃķrlitliga artefakten i banan, vilket ÃĪr viktigt fÃķr alla distributioner som visar agentsummeringar fÃķr mÃĪnniskor som bevis fÃķr vad som gjordes.’

I slutet av artikeln drar fÃķrfattarna slutsatsen att lÃĨngkontextresonemang ensamt ÃĪr osannolikt att gÃķra fÃķretags-AI tillfÃķrlitligt fÃķlja fÃķretagets policy. IstÃĪllet bÃķr policyefterlevnad alltmer pÃĨtvingas genom deterministiska yttre kontroller, utÃķver arbetsflÃķdes rÃĪcken.

Slutsats

Åsikt En intressant ÃķvervÃĪgning ÃĪr den till sist hur lÃĨngt miljÃķer som de som skapats fÃķr experimenten kommer att omgestaltas fÃķr att underlÃĪtta AI, snarare ÃĪn att tvinga LLM:er att tolka samma former och format som definierar mÃĪnskliga kontorsmiljÃķer. Till exempel skickade en affÃĪrskontakt mig igÃĨr fÃķr fÃķrsta gÃĨngen en .md-Ãķversikt som ÃĪr avsedd att utforskas av en LLM, snarare ÃĪn att lÃĪsas i en linjÃĪr form.

Och jag anpassar mig ocksÃĨ alltmer till de visuella och textbaserade begrÃĪnsningarna under LLM-samtal, samt vÃĪljer och accepterar filformat som jag normalt inte skulle vÃĪlja, eftersom de underlÃĪttar LLM-arbetsflÃķdet mer skickligt.

DÃĪrfÃķr ÃĪr det underhÃĨllande att se grÃĪnsÃķverskridande modeller snubbla runt i David Brents vÃĪrld, men man undrar om detta ÃĪr den mest sannolika scenariot fÃķr “agenten pÃĨ kontoret”.

 

Publicerad onsdag, 29 juli 2026. Uppdaterad 18:41 EET, fixade trasig lÃĪnk.

FÃķrfattare pÃĨ maskinlÃĪrning, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]