Anderson’un Açısı

AI, Çalışan El Kitabına Saygı Göstermekte Zorlanıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Yeni bir benchmark, işyeri AI ajanlarının şirket kurallarını ihlal ettiğini, yetkisiz işten çıkarmalar gibi yasaklanmış eylemleri gerçekleştirdiğini ve sonra da uyumlu olduklarını yanlış bir şekilde rapor ettiğini ortaya koyuyor.

 

İlginç bir yeni araştırma çalışması, önde gelen LLM modellerini, bir simüle şirket ortamında talimatları izlemek, tüm insan uzmanları tarafından oluşturulan bir çalışan el kitabının tüm ilkelerini saygı göstermek, astlar ve üstler tarafından gelen çelişen veya karıştırıcı direktif ve güncellemelerin selini müzakere etmek ve PDF’ler, Jira gönderileri ve tipik bir insan ofis senaryosundan diğer熟悉 platformlar ve araçlardan görevleri gerçekleştirmek zorunda bıraktı.

Eğer ofiste çalıştıysanız (veya en azından Office Space izlediniz), araştırma yazarlarının yeni çalışmasına karşılaştıkları çelişen sinyalleri ve karıştırıcı sinyal-gürültü oranını tanıyacaksınız:

Günlük olarak birçok ofis çalışanın karşılaştığı değişkenler fırtınası, agentic ön modelleri test etmek için sanal bir ortama distile edilmiştir. Kaynak - https://surgehq.ai/blog/handbook-md

Günlük olarak birçok ofis çalışanın karşılaştığı değişkenler fırtınası, agentic ön modelleri test etmek için sanal bir ortama distile edilmiştir. Kaynak

Önde gelen AI sistemlerinin burada karşılaştığı ana zorluk, sağlanan Çalışan İlişkileri el kitabını tüm sonraki komutlar için bir filtre olarak korumak zorunda olmalarıdır. Eğer कभी ChatGPT veya Claude’a bir oturumun başlangıcında verdiğiniz talimatları hatırlatmasını sağlamak için mücadele ettiyseniz, AI’nın bağlam penceresi sık sık daha önceki promtleri unuttuğunu ve sürekli olarak varsayılan davranışına döndüğünü bilirsiniz.

Bu nedenle, testlerde Claude Fable 5, GPT-5.5 ve diğer önde gelen modeller, yetkisiz bir yöneticiden aldıkları emir üzerine çalışanları işten çıkardılar; yöneticilerin onayını gerektirmeyen faturaları onayladılar; şirket politikası tarafından açıkça reddedilen süresiz laboratuvar sonuçlarını kabul ettiler ve sonra el kitabına uyduğunu bildirdiler – birçok şirket politikası ihlali arasında.

Yeni çalışmanın yazarları şunları söylüyor:

‘Başarısızlıklar tutarlı kalıplar izler: ajanlar, ortam içindeki inandırıcı bir isteği sürekli politikaya göre geçersiz kılar, gerekli bir kontrolü gerçekleştirir ve sonra sonuçlarına karşı hareket eder, uzun vadeli olarak kural ayrıntılarını kaybeder ve ulaşamadıkları uyumu bildirir.’

Başarısızlık analizi bazı komik örnekler içerir: bir finans görevinde Claude Opus 4.8, doğru bir şekilde 7.500 dolarlık bir masrafın aynı junior analist tarafından onaylandığını keşfetti, bu da şirket politikasını ihlal ediyordu.

Sonra, analisti gerçekten Mali Kontrolör olarak inanmaya kendini inandırdı ve ödemeyi onayladı:

‘Kendi düşünce zincirinde onu Kontrolör olarak terfi ettirdikten sonra, model öğeyi temizledi ve gerçek Kontrolöre, her 5.000 doların üzerinde her öğenin belgelenmiş onayını onayladığını mesajla bildirdi.

‘Başarısızlık, eksik bir yetenek değildir; doğru karar için gereken her gerçek, model tarafından kendisi tarafından zaten elde edilmiştir.’

Claude Opus 4.8'in 7.500 doları uzlaştırmakta nasıl başarısız olduğu. Kaynak - https://surgehq.ai/blog/handbook-md

Claude Opus 4.8’in 7.500 doları uzlaştırmakta nasıl başarısız olduğu.

Başka bir yerde, Gemini 3.5 Flash, laboratuvar sonuçlarının süresinin dolmasına rağmen, laboratuvar raporunu açmadan bile sigorta evraklarını laboratuvar sonuçları ile gönderdi:

‘Gemini 3.5 Flash, laboratuvar PDF’sine karşı tek bir okuma çağrısı yapmadan, önceden yetkilendirmeyi sigortacıya gönderdi, sonra da durumu “Standart İşlem Yöntemi”ne göre işlediğini bildirdi.’

Benchmark boyunca, yazarlar ayrıca birçok modelin, el kitabının ihlal ettiği bölümlerini cita ederek, her şirket kuralına uyduğunu iddia ettiğini buldu.

Ek mantık genellikle yardımcı olmadı; örneğin, GPT-5.5, artan mantık çabasıyla hiçbir iyileşme göstermedi, bazı modeller ise aslında doğru kararı bırakıp, politika ihlal eden bir kararı tercih ederek daha kötü performans gösterdi.

Sonuçta, Claude Fable 5, %36,2’lik en yüksek katı geçme oranını elde etti; GPT-5.6 Sol, %23,5’lik ikinci en yüksek oranı elde etti ve GPT-5.5 ile Claude Opus 4.8, %21,5-21,9 arasında puan aldı.

Değerlendirilen diğer modellerin çoğu, %16’nın altında puan aldı ve çoğu ön model, benchmark’ın katı değerlendirme kriterlerine göre %25’in altında puan aldı:

En iyi performans gösteren AI aracının, benchmark'ın politika tarafından yönetilen işyeri görevlerinin yalnızca biraz üzerinde bir kısmını tamamladığı, çoğu önde gelen modelin ise katı değerlendirme altında üçte ikiden fazlasını başaramadığı şekilde, benchmark'ın 65 işyeri görevini tamamlayan 30 model konfigürasyonunun liderlik tablosu. Puanlar, her görev için dört deneme üzerinden benchmark'ın 65 işyeri görevinin yüzde olarak ifade edilen oranını temsil etmektedir. Eşit puanlar aynı sırayı paylaşıyor.

En iyi performans gösteren AI aracının, benchmark’ın politika tarafından yönetilen işyeri görevlerinin yalnızca biraz üzerinde bir kısmını tamamladığı, çoğu önde gelen modelin ise katı değerlendirme altında üçte ikiden fazlasını başaramadığı şekilde, benchmark’ın 65 işyeri görevini tamamlayan 30 model konfigürasyonunun liderlik tablosu. Puanlar, her görev için dört deneme üzerinden benchmark’ın 65 işyeri görevinin yüzde olarak ifade edilen oranını temsil etmektedir. Eşit puanlar aynı sırayı paylaşıyor. Kaynak

Çözüm olarak, yazarlar, kritik şirket politikalarının, uzun bağlam belleği yerine, AI dışında deterministik araç çağırma koruyucuları (yani, yasaklanmış eylemleri engelleyen sabit kontroller) ile zorlanmasını öneriyorlar.

Ayrıca, HANDBOOK.md’yi, uzun bağlam politikasına uyumu ölçmek ve izlemek için standart bir benchmark olarak kullanarak, gelecekteki agentic modellerin geliştirilmesini öneriyorlar.

Yeni makale, HANDBOOK.md: Uzun Bağlamlı Agentic Talimat Takip Benchmarkı olarak adlandırılmış ve surge.ai’den yedi yazar tarafından yazılmıştır. Makale, testleri yeniden üretmek için docker dosyaları ve diğer gereksinimleri içeren bir GitHub deposu ile birlikte gelmektedir.

Yöntem

HANDBOOK.md benchmarkı için, finans, insan kaynakları, sigorta, lojistik ve tıbbi faturalama dahil olmak üzere 65 simüle ofis senaryosu oluşturuldu ve her biri, bir modeli, dosya erişimine ek olarak, Gmail, Slack gibi şirket hizmetlerine erişim sağlayan bir konteynırlı şirket ortamına yerleştirdi.

Her görev, 20 ila 124 sayfa arasında değişen bir el kitabına göre yönetildi, bu el kitabını model, PDF, Word veya HTML belgeleri olarak aldı ve görev boyunca ilgili kuralları bulmak, okumak ve uygulamak zorunda kaldı.

On uzman tarafından yazılmış temel elkitaplar, gerçek endüstri politikalarından uyarlandı, ardından her görev, farklı onay yetkilileri, eşiği, geçerlilik süresi ve prosedürel kuralları olan kendi değiştirilmiş versiyonuna sahip oldu, böylece hafızalama engellenmiştir:

‘Uzmanlar, endüstrilerinden gerçek politikaları uyarlayarak on temel elkitabı yazdı. Her biri, kurallar listesi yerine, uzun, çok bölümlü bir işletme belgesidir.

‘Temel bir İnsan Kaynakları elkitabı, 19 numaralı bölüm içerir: genel bakış, tanımlar, İnsan Kaynakları ekibi ve temaslar, Slack kanal haritası, referans dosyaları ve sistemler, istek taksonomileri, triyaj ve yönlendirme kuralları, SLA’larla öncelik matrisi, işe alma, işten çıkarma, izin, performans ve işe alma prosedürleri, yükseltme yolları, e-posta temizleme kuralları ve gerekli şablonlar ve varsayılan formatlar kütüphanesi’

Başarı, hem gereken eylemleri hem de yasaklanmış eylemleri kapsayan 824 deterministik Python tabanlı doğrulama kontrolü ile ölçüldü, bu da benchmark’ın, bir görevin tamamlanıp tamamlanmadığını değil, aynı zamanda şirket politikasının yol boyunca ihlal edilip edilmediğini de tespit etmesini sağladı.

On bir sağlayıcıdan otuz model konfigürasyonu değerlendirildi ve testler sırasında her görev, dört kez aynı koşullar altında tekrarlandı.

Geleneksel benchmark’lardan farklı olarak, HANDBOOK.md, yalnızca gerekli eylemlerin tamamlanıp tamamlanmadığını değil, aynı zamanda yasaklanmış eylemlerin kaçınıp kaçılmadığını da değerlendirdi, böylece ajanlar, istenen görevi tamamlamalarına rağmen başarısız olabilir.

Ortam ve Araçlar

Her simüle ofis ortamı, her modelin aynı araçlara erişebileceği şekilde standardize edilmiş bir Docker ortamında çalışmak üzere tasarlanmıştır, bu da sonuçları etkileyebilecek yazılım kullanılabilirliği farklılıklarını ortadan kaldırır:

AI modellerinin çalışmak zorunda olduğu ofis ortamının kaba bir temsili.

AI modellerinin çalışmak zorunda olduğu ofis ortamının kaba bir temsili.

Ortamlar ayrıca, ajanın gerçekleştirdiği her eylemi korur, bu da benchmark’ın deterministik değerlendirme sisteminin, son結果a yol açan eylemler dizisini değerlendirmesini sağlar.

Metrikler

Performans, bir görevin yalnızca tüm değerlendirme ölçütlerini karşıladığı durumlarda başarılı olarak kabul edildiği katı geçme @1 ile主要 olarak ölçüldü. Herhangi bir gereksinimin kaçırılması veya politika ihlali, başarısızlık ile sonuçlanacaktı, bu da, bir yanlış eylem bir başka şekilde yetenekli bir iş akışını geçersiz kılabilen kurumsal ayarları yansıtıyordu.

Daha esnek bir ölçüt olan geçme @1 (N−1) de kullanıldı, burada her görev için bir başarısız ölçütüne izin verildi, böylece near-misses tam başarısızlıklardan ayırt edilebildi.

Ek analiz için, her modelin ortalama per-kriter puanı kaydedildi, ancak bu, benchmark’ın başlıca sıralamalarında kullanılmadı.

Genel Yaklaşım

On uzman tarafından yazılmış elkitaplar, gerçek şirket politikalarından uyarlandı, ardından her biri, farklı onay zincirleri, eşiği, geçerlilik süresi ve prosedürel kuralları olan görevle ilgili kendi değiştirilmiş versiyonuna sahip oldu.
Gerçekçi ofis ortamları, her elkitabına göre oluşturuldu, bu da e-postalar, takvimler, Slack sohbetleri, elektronik tablolar ve diğer işyeri artefaktları içeriyordu.

Her görev, gerçek model başarısızlıklarını benchmark itself’in kusurlarından ayırt eden değerlendirme ölçütlerini güvenilir bir şekilde sağlayana kadar tekrar tekrar test edildi:

‘Uzmanlar, endüstrilerinden gerçek politikaları uyarlayarak on temel elkitabı yazdı. Her biri, kurallar listesi yerine, uzun, çok bölümlü bir işletme belgesidir.

‘Temel bir İnsan Kaynakları elkitabı, 19 numaralı bölüm içerir: genel bakış, tanımlar, İnsan Kaynakları ekibi ve temaslar, Slack kanal haritası, referans dosyaları ve sistemler, istek taksonomileri, triyaj ve yönlendirme kuralları, SLA’larla öncelik matrisi, işe alma, işten çıkarma, izin, performans ve işe alma prosedürleri, yükseltme yolları, e-posta temizleme kuralları ve gerekli şablonlar ve varsayılan formatlar kütüphanesi’

Testler ve Sonuçlar

Hatta en güçlü modeller bile, benchmark’ın katı puanlama sistemi altında, çoğu görevi başaramadı ve performans, bir tepe noktasında toplanmak yerine geniş bir aralıkta dağıldı:

Tüm 30 değerlendirilen model konfigürasyonunun, HANDBOOK.md benchmark'ının katı geçme @1 puanlarına göre sıralanmış ilk liderlik tablosu. Puanlar, her görev için dört deneme üzerinden benchmark'ın 65 işyeri görevinin yüzde olarak ifade edilen oranını temsil etmektedir. Eşit puanlar aynı sırayı paylaşıyor.

Tüm 30 değerlendirilen model konfigürasyonunun, HANDBOOK.md benchmark’ının katı geçme @1 puanlarına göre sıralanmış ilk liderlik tablosu. Puanlar, her görev için dört deneme üzerinden benchmark’ın 65 işyeri görevinin yüzde olarak ifade edilen oranını temsil etmektedir. Eşit puanlar aynı sırayı paylaşıyor.

Modeller arasında, mantık ayarlarındaki farklılıklar önemli ölçüde değişiyordu, ek mantık bazen performansı iyileştirirken, bazen hiçbir fark yaratmazken ve bazen kötüleştiriyordu:

‘Mantık çabası, düzensiz bir şekilde yardımcı oluyor. Çaba artışı, Opus 4.8 (+3.0), Sonnet 4.6 (+2.7) ve Fable 5 (+2.0)’e yardımcı oluyor, GPT-5.5’i değiştirmiyor (her iki ayar için %21,5) ve GLM 5.2’ye (-2.7) zarar veriyor.’

‘Ek düşünme, yalnızca temel başarısızlığın bir kaçırılan çıkarım değil de bir kaçırılan okuma olduğu zaman, kurala uyumu dönüştürüyor gibi görünüyor.’

Claude Fable 5, %36,2’lik en yüksek puanı elde etti, Claude Fable 5, %34,2’lik ikinci en yüksek puanı elde etti ve GPT-5.6 Sol (maks), %23,5’lik puan elde etti. GPT-5.5 ve Claude Opus 4.8, %20 civarında bir puanla sonraki seviyeyi oluşturdu, kalan ön modellerin çoğu %16’nın altında puan aldı. En düşük sıradaki modeller, görevlerin %2’sinden azını tamamladı.

Çalışmanın ayrıntılı başarısızlık analizi, sorunun genellikle eksik bilgi olmaktan ziyade, ilgili elkitabı kuralları ve destekleyici kanıtların zaten elde edildiğini, ancak ek mantığın bazen modellerin doğru sonuçtan vazgeçip politika ihlal eden bir sonucu tercih etmelerine neden olduğunu gösteriyor.

Çalışma ayrıca, LLM’lerin manyetik girişimlerinin karakterize ettiği kendi kendini aldatma düzeyini vurguluyor:

‘Neredeyse her başarısız yolculuk, elkitabının izlendiğini iddia eden ayrıntılı, iyi yapılandırılmış ve yanlış bir raporla sona erer…’

‘… Benchmark boyunca, ajanın kendi raporu, insanlara ne yapıldığının kanıtı olarak sunulan en az güvenilir artifacttır.’

Sonuç olarak, yazarlar, uzun bağlam mantığının, şirket politikasına uyumu güvenilir bir şekilde sağlayamayacağı sonucuna varıyorlar. Bunun yerine, politika uyumu, iş akışı koruyucuları eklenerek, deterministik dış kontrollerle giderek daha fazla zorlanmalıdır.

Sonuç

Görüş Bir ilgi çekici düşünce, deneyler için oluşturulan ortamların, LLM’leri yorumlamak yerine AI’yi kolaylaştırmak için nasıl yeniden hayal edileceği konusunda geliyor. Örneğin, dün, bir iş teması bana, LLM tarafından keşfedilmek üzere tasarlanmış bir .md özeti gönderdi, lineer bir şekilde okunmak yerine.

Ben de, LLM sohbetleri sırasında görsel ve metinsel kısıtlamalara giderek daha fazla uyum sağlıyor ve genellikle LLM iş akışını daha iyi destekleyen dosya formatlarını seçiyorum ve kabul ediyorum.

Öyleyse, sınırlı modellerin David Brent’in dünyasında nasıl sendelediğini izlemek eğlenceli olsa da, bu durumun ‘ajant ofis çalışanı’ için en muhtemel senaryo olup olmadığı merak konusu.

 

Çarşamba, 29 Temmuz 2026’da ilk kez yayınlandı. 18:41 EET’de güncellendi, kırık bağlantı düzeltildi.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai