Andersonin kulma

Tekoäly kamppailee työntekijän käsikirjan kunnioittamisessa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Uusi vertailutesti osoittaa, että työpaikan tekoälyagentit sivuuttavat yrityksen säännöt, tekevät kiellettyjä toimia, kuten luvattomia irtisanomisia, ja ilmoittavat sitten virheellisesti noudattaneensa sääntöjä.

Mielenkiintoisessa uudessa tutkimuksessa johtavat suuret kielimallit asetettiin tilanteeseen, jossa niiden piti toimia ohjeiden mukaisesti simuloidussa yrityksessä, noudattaa kaikkia ihmisten eli alan asiantuntijoiden laatiman henkilöstökäsikirjan määräyksiä, selviytyä alaisten ja esihenkilöiden ristiriitaisten tai epäselvien ohjeiden ja päivitysten tulvasta sekä suorittaa tehtäviä PDF-tiedostojen, Jira-viestien ja muiden tavallisesta toimistotyöstä tuttujen alustojen ja työkalujen avulla.

Jos olet joskus työskennellyt toimistossa tai ainakin nähnyt elokuvan Office Space, tunnistat ristiriitaiset viestit ja hämmentävän signaali-kohinasuhteen, joilla tutkimuksen tekijät haastavat kielimalleja:

The storm of variables many office workers must contend with daily, distilled into a virtual environment to test agentic frontier models. Source - https://surgehq.ai/blog/handbook-md

Monien toimistotyöntekijöiden päivittäin kohtaama muuttujien myrsky tiivistettiin virtuaaliympäristöksi, jossa testataan edistyneitä agenttimalleja. Lähde

Keskeinen haaste jopa kaikkein edistyneimmille tekoälyjärjestelmille on pitää annettu henkilöstöasioiden käsikirja kaikkien myöhempien käskyjen suodattimena. Jos olet joskus yrittänyt saada ChatGPT:n tai Clauden muistamaan istunnon alussa antamasi ohjeet, tiedät, että tekoälyn konteksti-ikkuna saa sen usein unohtamaan aiemmat kehotteet ja palaamaan jatkuvasti oletustoimintaansa.

Siksi Claude Fable 5, GPT-5.5 ja muut johtavat mallit irtisanoivat testeissä työntekijöitä saatuaan käskyn johtajalta, jolla ei ollut siihen valtuuksia, hyväksyivät laskuja ilman vaadittua esihenkilön hyväksyntää, hyväksyivät vanhentuneita laboratoriotuloksia, jotka yrityksen käytäntö nimenomaisesti kielsi, ja ilmoittivat sitten noudattaneensa käsikirjaa tunnollisesti. Nämä olivat vain osa lukuisista sääntörikkomuksista.

Tutkimuksen tekijät toteavat:

”Epäonnistumiset noudattavat samoja kaavoja: agentit antavat ympäristössä esitetyn uskottavan pyynnön ohittaa voimassa olevan käytännön, tekevät vaaditun tarkistuksen mutta toimivat sen tuloksen vastaisesti, kadottavat sääntöjen yksityiskohtia pitkissä tehtäväketjuissa ja raportoivat sääntöjen noudattamisesta, jota ei tapahtunut.”

Epäonnistumisten analyysissä on huvittavia esimerkkejä. Eräässä taloushallinnon tehtävässä Claude Opus 4.8 havaitsi oikein, että 7 500 dollarin kulun oli hyväksynyt sama nuorempi analyytikko, joka oli toimittanut sen, vastoin yrityksen käytäntöä.

Sitten malli päätteli itsensä uskomaan, että analyytikko olikin todellisuudessa taloushallinnon controller , ja hyväksyi maksun silti:

”Ylennettyään hänet controlleriksi omassa ajatusketjussaan malli hyväksyi kuluerän ja lähetti oikealle controllerille viestin vahvistaakseen, että jokaisella yli 5 000 dollarin erällä oli dokumentoitu hyväksyntä.

”Epäonnistuminen ei johdu puuttuvasta kyvystä: malli oli itse hakenut kaikki oikean päätöksen edellyttämät tiedot.”

How Claude Opus 4.8 failed to reconcile $7,500. Source - https://surgehq.ai/blog/handbook-md

Miten Claude Opus 4.8 epäonnistui 7 500 dollarin kulun tarkistamisessa.

Toisessa tehtävässä Gemini 3.5 Flash lähetti vakuutusasiakirjat käyttäen jo vanhentuneita laboratoriotuloksia avaamatta edes laboratorioraporttia, vaikka näytteenottopäivä näkyi tiedoston nimessä:

”Gemini 3.5 Flash lähetti ennakkolupahakemuksen vakuutusyhtiölle lukematta laboratorio-PDF:ää kertaakaan ja ilmoitti sitten käsitelleensä tapauksen ’tiukasti vakiotoimintamenettelyn mukaisesti’.”

Tekijät havaitsivat koko vertailutestissä myös, että monet mallit väittivät itsevarmasti noudattaneensa jokaista yrityksen sääntöä ja viittasivat samalla juuri niihin käsikirjan kohtiin, joita olivat rikkoneet.

Lisä päättely ei usein auttanut. Esimerkiksi GPT-5.5 ei parantanut tulostaan suuremmalla päättelypanoksella, ja joidenkin mallien suoritus jopa heikkeni niiden ilmeisesti päätellessä itsensä pois oikeasta ratkaisusta.

Lopullisissa tuloksissa Claude Fable 5 saavutti korkeimman tiukan läpäisyasteen, 36,2 %. GPT-5.6 Sol sijoittui toiseksi 23,5 prosentilla, ja GPT-5.5:n sekä Claude Opus 4.8:n tulokset olivat 21,5–21,9 %.

Useimmat muut arvioidut mallit jäivät alle 16 prosentin, ja useimmat edistyneimpien mallien kokoonpanot jäivät alle 25 prosentin vertailutestin tiukoilla arviointikriteereillä:

The best-performing AI agent completed just over one-third of the benchmark's policy-governed workplace tasks, while most leading models failed more than three-quarters under strict evaluation. Source - https://cdn.prod.website-files.com/68dcd2ceb173c46fa029931c/6a3d6dad2852b9a91757a83e_leaderboard.png

Parhaiten suoriutunut tekoälyagentti suoritti hieman yli kolmanneksen sääntöjen ohjaamista työtehtävistä. Useimmat johtavat mallit epäonnistuivat tiukassa arvioinnissa yli kolmessa neljäsosassa tehtävistä. Lähde

Korjaukseksi tekijät ehdottavat, että yrityksen kriittisiä käytäntöjä valvotaan tekoälyn ulkopuolella deterministisillä työkalukutsujen suojauksilla eli ohjelmoiduilla tarkistuksilla, jotka estävät kielletyt toimet, sen sijaan että luotettaisiin pelkkään pitkän kontekstin muistiin .

He ehdottavat myös HANDBOOK.md:n käyttämistä standardoituna vertailutestinä, jolla mitataan ja seurataan pitkän kontekstin sääntöjen noudattamisen kehitystä tulevissa agenttimalleissa.

Uusi tutkimusartikkeli on nimeltään HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following, ja sen on kirjoittanut seitsemän surge.ai:n tutkijaa. Artikkeliin liittyy GitHub-tietovarasto , joka sisältää Docker-tiedostot ja muut testien toistamiseen tarvittavat aineistot.

Menetelmä

HANDBOOK.md-vertailutestiin luotiin 65 simuloitua toimistoskenaariota taloushallinnon, henkilöstöhallinnon, vakuutusten, logistiikan ja terveydenhuollon laskutuksen aloilta. Jokaisessa malli sijoitetaan kontitettuun yritysympäristöön, jossa on tiedostoja, sähköposteja, Slack-keskusteluja, kalentereita, Jira-tauluja ja muita tuttuja työvälineitä.

Jokaista tehtävää ohjasi 20–124-sivuinen käsikirja, joka toimitettiin PDF-, Word- tai HTML-asiakirjana eikä kehotteeseen upotettuna. Mallien oli siten etsittävä, luettava ja sovellettava asiaankuuluvia sääntöjä koko tehtävän ajan.

Kymmenen asiantuntijoiden kirjoittamaa peruskäsikirjaa mukautettiin todellisista toimialakäytännöistä. Jokainen tehtävä sai sitten oman versionsa, jossa hyväksymisvaltuudet, raja-arvot, voimassaoloajat ja menettelysäännöt vaihtelivat, jotta estettäisiin ulkoa muistaminen:

”Alan asiantuntijat kirjoittivat kymmenen peruskäsikirjaa mukauttamalla toimialojensa todellisia käytäntöjä. Jokainen on pitkä, moniosainen toiminta-asiakirja eikä pelkkä sääntöluettelo.

”Tyypillinen henkilöstöhallinnon käsikirja sisältää 19 numeroitua osiota: yleiskatsauksen, määritelmät, HR-tiimin ja yhteystiedot, Slack-kanavakartan, viitetiedostot ja järjestelmät, pyyntöjen luokittelun, alustavan arvioinnin ja ohjauksen säännöt, priorisointimatriisin palvelutasosopimuksineen, perehdytyksen, työsuhteen päättämisen, vapaiden, suoriutumisen ja rekrytoinnin menettelyt, eskalointipolut, sähköpostien hallinnan säännöt sekä vaadittujen mallipohjien ja oletusmuotojen kirjaston.”

Onnistumista mitattiin 824 deterministisellä Python-tarkistuksella, jotka kattoivat sekä vaaditut että kielletyt toimet. Näin vertailutesti pystyi havaitsemaan paitsi tehtävän valmistumisen myös sen, rikottiinko yrityksen käytäntöjä matkan varrella.

Arvioinnissa oli 30 mallikokoonpanoa 11 toimittajalta. Jokainen tehtävä toistettiin testeissä neljä kertaa samoissa olosuhteissa.

Tavanomaisista vertailutesteistä poiketen HANDBOOK.md arvioi sekä vaadittujen toimien tekemistä että kiellettyjen välttämistä. Agentti saattoi siis epäonnistua, vaikka se suoritti pyydetyn tehtävän.

Ympäristöt ja työkalut

Jokainen simuloitu työympäristö on suunniteltu toimimaan standardoidussa Docker-ympäristössä. Kaikilla malleilla on samat työkalut käytettävissään, eivätkä ohjelmistojen saatavuuserot vaikuta tuloksiin. Vertailutesti tarjoaa agenteille realistisen toimistotyötilan, jossa on pääsy tiedostoihin sekä edellä mainittuihin yrityspalveluihin, kuten Gmailiin ja Slackiin:

A rough representation of the office environment the models must operate within.

Karkea kuvaus toimistoympäristöstä, jossa mallien on toimittava.

Ympäristöt tallentavat myös jokaisen agentin tekemän toimen. Näin vertailutestin deterministinen arviointijärjestelmä voi arvioida koko lopputulokseen johtaneen toimintaketjun.

Mittarit

Suorituskykyä mitattiin ensisijaisesti mittarilla strict pass@1, jossa tehtävä katsottiin onnistuneeksi vain, jos jokainen arviointikriteeri täyttyi. Yksikin täyttymätön vaatimus tai sääntörikkomus merkitsi epäonnistumista. Tämä vastaa yritysympäristöjä, joissa yksi väärä toimi voi mitätöidä muuten pätevän työnkulun.

Myös sallivampaa mittaria pass@1 (N−1) käytettiin. Siinä sallittiin yksi epäonnistunut kriteeri tehtävää kohti, jotta lähes onnistuneet suoritukset voitiin erottaa täydellisistä epäonnistumisista.

Lisäanalyysia varten kirjattiin kunkin mallin keskimääräinen kriteerikohtainen pistemäärä, mutta sitä ei käytetty vertailutestin pääasiallisessa paremmuusjärjestyksessä.

Yleinen lähestymistapa

Kymmenen asiantuntijoiden kirjoittamaa käsikirjaa mukautettiin yritysten todellisista käytännöistä. Jokaisesta tehtiin sitten useita tehtäväkohtaisia versioita, joiden hyväksymisketjut, raja-arvot ja menettelyt vaihtelivat. Jokaisen käsikirjan ympärille rakennettiin realistinen toimistoympäristö sähköposteineen, kalentereineen, Slack-keskusteluineen, laskentataulukoineen ja muine työaineistoineen.

Jokaista tehtävää hiottiin toistuvissa testeissä, kunnes arviointikriteerit erottivat luotettavasti mallien aidot epäonnistumiset vertailutestin omista puutteista. Kriteerit, jotka hylkäsivät oikean toiminnan tai hyväksyivät vääriä ratkaisuja, korjattiin ennen julkaisua.

Testit ja tulokset

Vahvimmatkin mallit epäonnistuivat useimmissa tehtävissä vertailutestin tiukalla arviointijärjestelmällä. Tulokset jakautuivat laajalle sen sijaan, että ne olisivat kasautuneet huipulle:

The initial results leaderboard ranking all 30 evaluated model configurations by their strict pass@1 scores on the HANDBOOK.md benchmark. Scores represent the percentage of the benchmark's 65 workplace tasks completed without a single failed evaluation criterion across four trials per task. Tied scores share the same rank.

Alustava tulostaulukko järjestää kaikki 30 arvioitua mallikokoonpanoa HANDBOOK.md-vertailutestin strict pass@1 -pistemäärän mukaan. Pisteet ilmaisevat, kuinka suuri prosenttiosuus 65 työtehtävästä suoritettiin ilman yhtäkään epäonnistunutta arviointikriteeriä neljässä yrityksessä tehtävää kohti. Tasapisteet saavat saman sijoituksen.

Päättelyasetusten vaikutus vaihteli huomattavasti mallien välillä: lisäpäättely toisinaan paransi suorituskykyä, toisinaan vaikutti vain vähän ja toisinaan heikensi sitä:

”Päättelypanos auttaa epätasaisesti. Sen lisääminen parantaa Opus 4.8:n (+3,0), Sonnet 4.6:n (+2,7) ja Fable 5:n (+2,0) tulosta, jättää GPT-5.5:n ennalleen (21,5 % molemmilla asetuksilla) ja heikentää GLM 5.2:n tulosta (−2,7).

”Lisäharkinta näyttää muuttuvan sääntöjen noudattamiseksi vain silloin, kun taustalla oleva epäonnistuminen johtuu puuttuvasta päätelmästä eikä tekemättä jääneestä [lukemisesta].”

Claude Fable 5 saavutti korkeimman pistemäärän, 36,2 %, ja sen jälkeen tulivat Claude Fable 5 tuloksella 34,2 % sekä GPT-5.6 Sol (max) tuloksella 23,5 %. GPT-5.5 ja Claude Opus 4.8 muodostivat seuraavan tason noin 20 prosentissa. Useimmat muut edistyneet mallit jäivät alle 16 prosentin. Heikoimmin sijoittuneet mallit suorittivat alle 2 % tehtävistä.

Tutkimuksen yksityiskohtainen epäonnistumisanalyysi viittaa siihen, ettei ongelmana usein ollut tiedon puute: käsikirjan asiaankuuluvat säännöt ja niitä tukevat tiedot oli jo haettu. Lisäpäättely saattoi silti saada mallin hylkäämään oikean johtopäätöksen uskottavan mutta sääntöjä rikkovan ratkaisun hyväksi.

Tutkimus nostaa esiin myös itsepetoksen, joka leimaa monia kielimallien yrityksiä:

”Lähes jokainen epäonnistunut toimintaketju päättyy itsevarmaan ilmoitukseen käsikirjan noudattamisesta. Usein siinä viitataan nimenomaan rikottuihin kohtiin. Raportit ovat yksityiskohtaisia, hyvin jäsenneltyjä ja vääriä […]

”[…] Koko vertailutestissä agentin oma raportti on toimintaketjun epäluotettavin aineisto. Tämä on olennaista kaikessa käytössä, jossa agentin yhteenveto näytetään ihmiselle todisteena tehdyistä toimista.”

Lopuksi tekijät toteavat, ettei pitkän kontekstin päättely yksin todennäköisesti saa yritystekoälyä noudattamaan yrityksen käytäntöjä luotettavasti. Käytäntöjen noudattamista pitäisi yhä enemmän varmistaa deterministisillä ulkoisilla kontrolleilla työnkulun suojarajojen lisäksi.

Johtopäätös

Mielipide Yksi kiinnostava kysymys on, missä määrin kokeiden kaltaisia ympäristöjä lopulta suunnitellaan uudelleen tekoälyä varten sen sijaan, että kielimallit pakotetaan tulkitsemaan ihmisten toimistoympäristöille ominaisia lomakkeita ja esitystapoja. Esimerkiksi eilen eräs liikekontakti lähetti minulle ensimmäistä kertaa .md-yleiskatsauksen, joka oli suunniteltu kielimallin tutkittavaksi eikä luettavaksi alusta loppuun.

Myös minä omaksun ja mukaudun yhä enemmän kielimallikeskustelujen visuaalisiin ja tekstuaalisiin rajoitteisiin. Valitsen ja hyväksyn tiedostomuotoja, joita en tavallisesti käyttäisi, koska ne sopivat kielimallien työnkulkuihin paremmin.

Siksi, vaikka on huvittavaa katsella edistyneimpien mallien kompurointia David Brentin maailmassa, herää kysymys, onko tämä todennäköisin ympäristö ”agenttimaiselle toimistotyöntekijälle”.

Julkaistu ensimmäisen kerran keskiviikkona 29. heinäkuuta 2026. Päivitetty klo 18.41 EET: rikkinäinen linkki korjattu.

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai