Anderson’un Açısı

AI, Çalışan El Kitabına Saygı Göstermekte Zorlanıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Yeni bir kıyaslama testi, işyerindeki yapay zekâ ajanlarının şirket kurallarını göz ardı ettiğini, yetkisiz işten çıkarmalar gibi yasak eylemleri gerçekleştirdiğini ve ardından kurallara uyduklarını yanlış biçimde bildirdiğini ortaya koyuyor.

İlginç bir yeni araştırma, önde gelen büyük dil modellerini bir sanal şirket içinde talimatları izlemek zorunda oldukları bir ortama yerleştirdi. Modellerin, alan uzmanlarının hazırladığı çalışan el kitabının bütün kurallarına uymaları; astlardan ve üstlerden gelen çelişkili veya kafa karıştırıcı talimat ve güncelleme seliyle başa çıkmaları; PDF’ler, Jira gönderileri ve sıradan bir insan ofisinden tanıdık platform ve araçlar üzerinden görevleri yerine getirmeleri gerekiyordu.

Daha önce bir ofiste çalıştıysanız ya da en azından Office Space filmini izlediyseniz, araştırmacıların dil modellerinin karşısına çıkardığı çelişkili sinyalleri ve şaşırtıcı sinyal-gürültü oranını tanıyacaksınız:

The storm of variables many office workers must contend with daily, distilled into a virtual environment to test agentic frontier models. Source - https://surgehq.ai/blog/handbook-md

Birçok ofis çalışanının her gün başa çıkmak zorunda olduğu değişkenler fırtınası, en gelişmiş ajan modellerini test etmek için sanal bir ortama aktarıldı. Kaynak

En ileri yapay zekâ sistemlerinin bile burada karşılaştığı temel zorluk, sağlanan Çalışan İlişkileri el kitabını sonraki bütün komutları süzen bir filtre olarak koruma gerekliliğidir. ChatGPT veya Claude’un bir oturumun başında verdiğiniz talimatları hatırlamasını sağlamaya çalıştıysanız, yapay zekânın bağlam penceresinin sık sık önceki istemleri unutmasına ve sürekli varsayılan davranışına dönmesine yol açtığını bilirsiniz.

Bu nedenle testlerde Claude Fable 5, GPT-5.5 ve diğer önde gelen modeller, yetkisi olmayan bir yöneticinin emriyle çalışanları işten çıkardı; gerekli yönetici onayı olmadan faturaları kabul etti; şirket politikasının açıkça reddettiği, geçerlilik süresi dolmuş laboratuvar sonuçlarını kullandı ve ardından el kitabını titizlikle izlediğini bildirdi. Bunlar şirket politikalarına yönelik çok sayıda ihlalden yalnızca birkaçıydı.

Yeni çalışmanın yazarları şöyle diyor:

“Başarısızlıklar tutarlı örüntüler izliyor: ajanlar, ortam içindeki makul bir talebin yürürlükteki politikayı geçersiz kılmasına izin veriyor, gerekli kontrolü yapıp sonucuna aykırı davranıyor, uzun süreçlerde kural ayrıntılarını kaybediyor ve sağlamadıkları bir uyumu sağladıklarını bildiriyor.”

Başarısızlık analizi bazı eğlenceli örnekler içeriyor. Bir finans görevinde Claude Opus 4.8, 7.500 dolarlık bir harcamanın onu sunan aynı kıdemsiz analist tarafından onaylandığını ve bunun şirket politikasını ihlal ettiğini doğru biçimde tespit etti.

Ardından kendisini analistin aslında Finans Kontrolörü olduğuna ikna edecek şekilde akıl yürüttü ve ödemeyi yine de onayladı:

“Model, kendi düşünce zinciri içinde analisti Kontrolörlüğe terfi ettirdikten sonra kalemi onayladı; ardından gerçek Kontrolöre mesaj göndererek 5.000 doların üzerindeki her kalemin belgelenmiş onayı bulunduğunu doğruladı.

“Başarısızlığın nedeni eksik bir yetenek değil; doğru karar için gereken bütün olgular modelin kendisi tarafından zaten elde edilmişti.”

How Claude Opus 4.8 failed to reconcile $7,500. Source - https://surgehq.ai/blog/handbook-md

Claude Opus 4.8’in 7.500 dolarlık harcamayı kontrol ederken nasıl başarısız olduğu.

Başka bir örnekte Gemini 3.5 Flash, numune alma tarihi dosya adında bile görünmesine rağmen laboratuvar raporunu açmadan, geçerlilik süresi dolmuş sonuçlarla sigorta evraklarını gönderdi:

“Gemini 3.5 Flash, laboratuvar PDF’sine yönelik tek bir okuma çağrısı yapmadan ön onay başvurusunu sigortacıya gönderdi ve ardından vakayı ‘Standart İşletim Prosedürüne kesinlikle uygun biçimde’ işlediğini bildirdi.”

Yazarlar test genelinde birçok modelin, az önce ihlal ettiği el kitabı bölümlerini kaynak göstererek bütün şirket kurallarına uyduğunu güvenle iddia ettiğini de tespit etti.

Ek akıl yürütme çoğu zaman işe yaramadı. Örneğin GPT-5.5, akıl yürütme çabası artırıldığında iyileşmedi; bazı modeller ise görünüşe göre akıl yürüterek kendilerini uzaklaştırdıkları doğru karar yerine daha kötü sonuçlara ulaştı.

Nihai sonuçlarda Claude Fable 5, %36,2 ile en yüksek katı geçme oranına ulaştı. GPT-5.6 Sol %23,5 ile ikinci oldu; GPT-5.5 ve Claude Opus 4.8 ise %21,5–21,9 aralığında puan aldı.

Değerlendirilen diğer modellerin çoğu %16’nın, en ileri modellerin yapılandırmalarının çoğu da testin katı değerlendirme ölçütleri altında %25’in altında kaldı:

The best-performing AI agent completed just over one-third of the benchmark's policy-governed workplace tasks, while most leading models failed more than three-quarters under strict evaluation. Source - https://cdn.prod.website-files.com/68dcd2ceb173c46fa029931c/6a3d6dad2852b9a91757a83e_leaderboard.png

En başarılı yapay zekâ ajanı, kıyaslama testindeki politikalara bağlı işyeri görevlerinin üçte birinden biraz fazlasını tamamladı. Önde gelen modellerin çoğu, katı değerlendirmede görevlerin dörtte üçünden fazlasında başarısız oldu. Kaynak

Yazarlar çözüm olarak, kritik şirket politikalarının yalnızca uzun bağlam belleğine dayanmak yerine, yapay zekânın dışında deterministik araç çağrısı korumalarıyla uygulanmasını savunuyor. Bunlar yasak eylemleri engelleyen, kodla tanımlanmış kesin kontrollerdir.

Ayrıca gelecekteki ajan modelleri geliştirilirken uzun bağlamdaki politikalara uyumun ilerlemesini ölçmek ve izlemek için HANDBOOK.md’nin standart bir kıyaslama testi olarak kullanılmasını öneriyorlar.

Yeni makalenin başlığı HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following ve çalışma surge.ai’den yedi yazara ait. Makaleye, testleri tekrarlamak için gereken Docker dosyalarını ve diğer bileşenleri içeren bir GitHub deposu eşlik ediyor.

Yöntem

HANDBOOK.md testi için finans, insan kaynakları, sigorta, lojistik ve tıbbi faturalandırmayı kapsayan 65 sanal ofis senaryosu oluşturuldu. Her senaryo modeli dosyalar, e-postalar, Slack konuşmaları, takvimler, Jira panoları ve tanıdık diğer işyeri araçlarını içeren konteynerleştirilmiş bir şirket ortamına yerleştiriyor.

Her görev, istemin içine gömülmek yerine PDF, Word veya HTML belgesi olarak sunulan 20 ila 124 sayfalık bir el kitabına tabiydi. Böylece modellerin görev boyunca ilgili kuralları bulması, okuması ve uygulaması gerekiyordu.

Uzmanların yazdığı on temel el kitabı gerçek sektör politikalarından uyarlandı. Daha sonra, ezberlemeyi önlemek için her göreve farklı onay yetkileri, eşikler, geçerlilik süreleri ve usul kuralları içeren değiştirilmiş bir sürüm verildi:

“Alan uzmanları, kendi sektörlerindeki gerçek politikaları uyarlayarak on temel el kitabını yazdı. Her biri bir kural listesinden ziyade uzun, çok bölümlü bir işletim belgesidir.

“Temsili bir insan kaynakları el kitabı 19 numaralı bölüm içerir: genel bakış, tanımlar, insan kaynakları ekibi ve iletişim bilgileri, Slack kanal haritası, başvuru dosyaları ve sistemleri, talep sınıflandırmaları, ön değerlendirme ve yönlendirme kuralları, hizmet seviyesi anlaşmalarını içeren öncelik matrisi, işe uyum, işten ayrılış, izin, performans ve işe alım prosedürleri, üst mercilere taşıma yolları, e-posta düzeni kuralları ve zorunlu şablonlarla varsayılan biçimlerden oluşan bir kütüphane.”

Başarı, hem zorunlu hem de yasak eylemleri kapsayan, Python tabanlı 824 deterministik doğrulama kontrolüyle ölçüldü. Böylece test yalnızca görevin tamamlanıp tamamlanmadığını değil, bu sırada şirket politikasının ihlal edilip edilmediğini de saptayabildi.

11 sağlayıcıdan 30 model yapılandırması değerlendirildi. Testlerde her görev aynı koşullarda dört kez tekrarlandı.

Geleneksel kıyaslama testlerinden farklı olarak HANDBOOK.md, hem gerekli eylemlerin tamamlanmasını hem de yasak eylemlerden kaçınılmasını değerlendirdi. Böylece ajanlar istenen görevi bitirseler bile başarısız sayılabiliyordu.

Ortamlar ve araçlar

Her sanal işyeri, bütün modellerin aynı araçlara erişmesini sağlayan standart bir Docker ortamında çalışacak şekilde tasarlandı. Bu, yazılım kullanılabilirliğindeki farklılıkların sonuçları etkilemesini önlüyor. Test, ajanlara dosya erişiminin yanı sıra Gmail ve Slack gibi daha önce belirtilen kurumsal hizmetleri içeren gerçekçi bir ofis çalışma alanı sunuyor:

A rough representation of the office environment the models must operate within.

Modellerin içinde çalışmak zorunda olduğu ofis ortamının genel bir gösterimi.

Ortamlar ayrıca ajanın gerçekleştirdiği her eylemi kaydediyor. Böylece testin deterministik değerlendirme sistemi, nihai sonuca götüren eylem dizisinin tamamını inceleyebiliyor.

Ölçütler

Performans öncelikle strict pass@1 ile ölçüldü. Bu ölçütte bir görev ancak başarılı sayılmak için gereken değerlendirme ölçütlerinin tamamı karşılandığında geçilmiş kabul ediliyor. Atlanan herhangi bir gereklilik veya politika ihlali başarısızlıkla sonuçlanıyor. Bu, tek bir yanlış eylemin başka açılardan yetkin bir iş akışını geçersiz kılabildiği kurumsal ortamları yansıtıyor.

Daha esnek bir ölçüt olan pass@1 (N−1) de kullanıldı. Burada görev başına bir başarısız ölçüte izin verildi; böylece başarıya çok yaklaşan denemeler tamamen başarısız olanlardan ayrılabildi.

Ek analiz için her modelin ölçüt başına ortalama puanı da kaydedildi, ancak bu değer testin ana sıralamalarında kullanılmadı.

Genel yaklaşım

Uzmanların yazdığı on el kitabı gerçek şirket politikalarından uyarlandı. Ardından her biri, farklı onay zincirleri, eşikler ve prosedürler içeren göreve özgü birden çok sürüme dönüştürüldü. Her el kitabının çevresinde e-postalar, takvimler, Slack konuşmaları, elektronik tablolar ve diğer işyeri belgelerini içeren gerçekçi ofis ortamları oluşturuldu.

Her görev, değerlendirme ölçütleri gerçek model başarısızlıklarını testin kendi kusurlarından güvenilir biçimde ayırabilene kadar tekrar tekrar sınanarak iyileştirildi. Doğru davranışı reddeden veya yanlış çözümleri kabul eden ölçütler yayımdan önce düzeltildi.

Testler ve sonuçlar

En güçlü modeller bile testin katı puanlama sistemi altında görevlerin çoğunda başarısız oldu. Performans sonuçları en üstte kümelenmek yerine geniş bir aralığa yayıldı:

The initial results leaderboard ranking all 30 evaluated model configurations by their strict pass@1 scores on the HANDBOOK.md benchmark. Scores represent the percentage of the benchmark's 65 workplace tasks completed without a single failed evaluation criterion across four trials per task. Tied scores share the same rank.

Değerlendirilen 30 model yapılandırmasının tamamını HANDBOOK.md testindeki strict pass@1 puanlarına göre sıralayan ilk sonuç tablosu. Puanlar, görev başına dört denemede, 65 işyeri görevinin tek bir değerlendirme ölçütünde bile başarısız olmadan tamamlanan yüzdesini temsil ediyor. Eşit puanlar aynı sırayı paylaşıyor.

Akıl yürütme ayarlarının etkisi de modele göre önemli ölçüde değişti. Ek akıl yürütme bazen performansı artırdı, bazen pek fark yaratmadı, bazen de düşürdü :

“Akıl yürütme çabası eşit biçimde yardımcı olmuyor. Çabanın artırılması Opus 4.8’i (+3,0), Sonnet 4.6’yı (+2,7) ve Fable 5’i (+2,0) iyileştiriyor; GPT-5.5’i değiştirmiyor (iki ayarda da %21,5) ve GLM 5.2’yi olumsuz etkiliyor (−2,7).

“Ek değerlendirme, yalnızca temel başarısızlık okunması gereken bir şeyin [okunmamasından] değil, yapılması gereken bir çıkarımın kaçırılmasından kaynaklandığında kurallara uyuma dönüşüyor gibi görünüyor.”

Claude Fable 5 %36,2 ile en yüksek puana ulaştı; ardından %34,2 ile Claude Fable 5 ve %23,5 ile GPT-5.6 Sol (max) geldi. GPT-5.5 ve Claude Opus 4.8 yaklaşık %20 ile sonraki grubu oluştururken, diğer en ileri modellerin çoğu %16’nın altında kaldı. En alt sıradaki modeller görevlerin %2’sinden azını tamamladı.

Makalenin ayrıntılı başarısızlık analizi, ilgili el kitabı kuralları ve destekleyici kanıtlar çoğu zaman zaten elde edilmiş olduğundan, sorunun genellikle bilgi eksikliği olmadığını gösteriyor. Yine de ek akıl yürütme bazen modellerin doğru sonucu bırakıp makul görünen ama politikayı ihlal eden bir sonucu seçmesine yol açıyordu.

Çalışma, büyük dil modellerinin birçok girişiminde görülen kendini aldatma düzeyine de dikkat çekiyor:

“Neredeyse her başarısız eylem dizisi, el kitabının izlendiğine dair kendinden emin bir ifadeyle bitiyor ve sıklıkla ihlal edilen belirli bölümlere atıfta bulunuyor. Raporlar ayrıntılı, iyi yapılandırılmış ve yanlış […]

“[…] Test genelinde ajanın kendi raporu, eylem dizisindeki en az güvenilir kayıttır. Bu, ajan özetlerini insanlara yapılanların kanıtı olarak gösteren her uygulama açısından önemlidir.”

Son olarak yazarlar, uzun bağlamlı akıl yürütmenin tek başına kurumsal yapay zekânın şirket politikalarını güvenilir biçimde izlemesini sağlamasının pek olası olmadığı sonucuna varıyor. Bunun yerine, iş akışı güvenlik sınırlarına ek olarak politikaya uyum giderek daha fazla deterministik dış kontrollerle sağlanmalı.

Sonuç

Görüş İlginç sorulardan biri, deneyler için oluşturulanlara benzer ortamların, büyük dil modellerini insan ofislerini tanımlayan aynı form ve biçimleri yorumlamaya zorlamak yerine, yapay zekâya uygun olacak şekilde ne ölçüde yeniden tasarlanacağıdır. Örneğin dün bir iş bağlantım bana ilk kez, baştan sona okunmak yerine bir büyük dil modeli tarafından incelenmek üzere tasarlanmış bir .md özeti gönderdi.

Ben de büyük dil modelleriyle konuşurken görsel ve metinsel sınırlamaları giderek daha fazla benimsiyor ve bunlara uyum sağlıyorum. Normalde seçmeyeceğim dosya biçimlerini, modelle yürütülen iş akışına daha iyi uydukları için seçip kabul ediyorum.

Dolayısıyla en ileri modellerin David Brent’in dünyasında tökezlemesini izlemek eğlenceli olsa da, bunun ‘ajan tabanlı ofis çalışanı’ için en olası senaryo olup olmadığını merak ediyor insan.

İlk yayımlanma: 29 Temmuz 2026 Çarşamba. 18.41 EET’de güncellendi; bozuk bağlantı düzeltildi.

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai