Yapay zeka modelleri ve platformları
AI Ajanlarının Gerçek Araştırma Konusunda Ne Kadar İyi Oldukları? Derin Araştırma Bench Raporunun İçinde
Büyük dil modelleri (LLM’ler) hızla evrimleşırken, güçlü araştırma asistanları olarak vaatleri de artıyor. Artık sadece basit gerçek sorulara cevap vermiyorlar, aynı zamanda “derin araştırma” görevlerini ele alıyor, bu görevler çok adımlı akıl yürütme, çelişkili bilgilerin değerlendirilmesi, web üzerinden veri kaynaklarının kullanılması ve bu verilerin tutarlı bir çıktı olarak sentezlenmesini içeriyor.
Bu ortaya çıkan yetenek artık farklı marka adları altında büyük laboratuvarlar tarafından pazarlanıyor – OpenAI buna “Derin Araştırma” diyor, Anthropic “Genişletilmiş Düşünme” olarak adlandırıyor, Google’ (GOOGL ) ın Gemini “Arama + Pro” özelliklerini sunuyor ve Perplexity bunu “Pro Arama” veya “Derin Araştırma” olarak etiketliyor. Ancak bu teklifler pratikte ne kadar etkili? FutureSearch tarafından hazırlanan bir rapor, Derin Araştırma Bench (DRB): Web Araştırma Ajanlarını Değerlendirme, bugüne kadar yapılan en kapsamlı değerlendirmeyi sunuyor ve sonuçlar hem etkileyici yetenekler hem de kritik eksiklikler ortaya koyuyor.
Derin Araştırma Bench Nedir?
FutureSearch ekibi tarafından oluşturulan Derin Araştırma Bench, AI ajanlarının çok adımlı, web tabanlı araştırma görevlerindeki performansını değerlendirmek için özenle tasarlanmış bir referans noktasıdır. Bu, basit sorularla cevaplanabilecek sorular değildir – bunlar, analistler, politika yapıcılar ve araştırmacılar tarafından gerçek dünya ortamlarında karşılaşılan karmaşık, açık uçlu zorlukları yansıtırlar.
Bu referans noktası, 89 farklı görevi 8 kategoride içerir, örneğin:
- Sayı Bul: örneğin, “FDA Sınıf II tıbbi cihaz geri çağrıları kaç tane oldu?”
- İddia Doğrula: örneğin, “ChatGPT, Google Arama’dan 10 kat daha enerji yoğundur?”
- Veri Seti Derle: örneğin, “2019-2023 yılları arasında ABD yazılım geliştiricileri için iş trendleri”
Her görev türü, insan tarafından doğrulanmış cevaplarla özenle yapılandırılmış ve dondurulmuş bir web sayfaları veri seti olan RetroSearch kullanılarak değerlendirilir. Bu, model değerlendirmeleri boyunca tutarlılığı sağlar ve canlı webin değişken durumunu önler.
Ajan Mimarisi: ReAct ve RetroSearch
Derin Araştırma Bench’in kalbinde ReAct mimarisi yer alır, yani “Akıl + Eylem”. Bu yöntem, bir insan araştırmacının bir sorunu nasıl ele alabileceğini taklit eder – görevi düşünerek, bir web araması gibi bir eylem gerçekleştirerek, sonuçları gözlemleyerek ve sonra yineleme kararı vererek veya sonuçlandırarak.
Daha önceki modeller bu döngüyü açıkça takip ederken, daha yeni “düşünen” modeller bu süreci daha akıcı hale getirerek akıl yürütmeyi eylemlerine daha sıkı bir şekilde entegre ederler. Değerlendirmeler boyunca tutarlılığı sağlamak için DRB, RetroSearch’i tanıtır – webin özel, statik bir sürümü. Canlı internet yerine, ajanlar, Serper, Playwright ve ScraperAPI gibi araçlar kullanılarak web sayfalarının bir arşivi olan RetroSearch’e erişirler. Bu, 189.000’den fazla sayfaya erişim sağlar, hepsi zaman içinde dondurulmuş olarak, adil ve tekrarlanabilir bir test ortamı sağlar.
Hangi AI Ajanları En İyi Performans Gösterir?
Tüm yarışmacılara bakıldığında, OpenAI’nin o3 modeli 0.51 puanla en yüksek performansı gösterdi. Bu, Deep Research Bench’in zorluğunu göz önünde bulundurmak önemlidir – görev tanımlarındaki belirsizlik ve puanlama nedeniyle, hatta mükemmel bir ajan bile 0.8’in üzerinde bir puan alamaz – bu, araştırmacıların “gürültü tavanı” olarak adlandırdıkları bir seviyedir. Yani, günümüzün en iyi modelleri bile hala iyi bilgilendirilmiş, metodik insan araştırmacıların gerisinde kalıyor.
Liderlik tablosu aydınlatıcı içgörüler sunuyor. o3 sadece liderliği ele geçirmekle kalmadı, aynı zamanda neredeyse tüm görev türlerinde hız ve tutarlılık gösterdi. Anthropic’in Claude 3.7 Sonnet modeli, “düşünen” ve “düşünmeyen” modlarda esneklik gösterdi. Google’ın Gemini 2.5 Pro modeli, yapılandırılmış planlama ve adım adım akıl yürütme gerektiren görevlerde öne çıktı. Açık ağırlıklı DeepSeek-R1, GPT-4 Turbo’nun performansını yakından takip etti ve açık modellerle kapalı modeller arasındaki performans farkını daralttı.
Genel olarak, yeni “düşünen” modellerin daha önceki modellerden daha iyi performans gösterdiği ve kapalı kaynaklı modellerin açık ağırlıklı alternatiflere göre belirgin bir avantaj sağladığı ortaya çıktı.
Ajanlar Nerede Zorlanıyor?
Derin Araştırma Bench raporunda vurgulanan başarısızlık kalıplarını okumak şaşırtıcı bir şekilde tanıdık geldi. Özellikle uzun araştırma veya içerik oluşturma seansları sırasında karşılaştığım en can sıkıcı yönlerden biri, bir AI ajanının simplemente ne yaptığımızı unutmaya başlamasıdır. Bağlam penceresi genişledikçe, model genellikle işin özünü kaybeder: ana ayrıntılar soluklaşır, hedefler bulanıklaşır ve cevaplar kopuk veya amaçsız hissetmeye başlar. Bir noktada, kaybettiğiniz her şeyi atıp yeniden başlamaktan daha iyi olduğunu öğrendim, hatta bu, her şeyin üretilmesini atmak anlamına gelse bile.
Bu unutkanlık sadece anekdotsal değil – Derin Araştırma Bench değerlendirmesinde başarısızlığın en önemli göstergesi. Ancak bu tek tekrarlanan sorun değil. Rapor ayrıca, bazı modellerin tekrarlanan araç kullanımına düşebileceğini, aynı aramayı tekrar tekrar gerçekleştirebileceğini ve sanki bir döngüde takılmış gibi davranabileceğini vurguluyor. Diğerleri, eleştirel olarak düşünmek yerine tembel bir şekilde anahtar kelime eşleştirmesi yapma eğiliminde. Ve çok sık, ajanlar erken sonuçlara kurban gidiyor – teknik olarak doğru olan ancak gerçek içgörüden yoksun bir cevap sunuyor.
Hatta en iyi modeller arasında bile farklılıklar çarpıcı. GPT-4 Turbo, Örneğin, önceki adımları unutmaya eğilimliyken, DeepSeek-R1 daha çok hayal kurma veya yanlış ancak inandırıcı bilgiler üretebilme eğilimindeydi. Genellikle, modeller sık sık kaynakları çapraz kontrol etmede veya bulgularını son çıktılarından önce doğrulamada başarısız oldular. Ciddi iş için AI’ye güvenen herkes için bu sorunlar çok tanıdık gelecek ve insanlara benzer şekilde düşünen ve araştıran ajanlar inşa etmemiz gereken uzun yolu vurgulayacak.
Hafıza Tabanlı Performans Nasıl?
İlginç bir şekilde, Derin Araştırma Bench ayrıca “araçsız” ajanları da değerlendirdi – dış araçlara, web aramasına veya belge geri çağırma gibi erişimi olmayan dil modelleri. Bu ajanlar, yalnızca dahili eğitim verilerine ve hafızalarına güvenerek, daha önce eğitim sırasında öğrendiklerine dayanarak cevaplar üretiyorlar. Bu, bir şeyleri arama veya doğrulama yetenekleri olmadan, sadece “hatırladıkları” şeylere göre tahmin ettiklerini anlamına geliyor.
Şaşırtıcı bir şekilde, bu araçsız ajanlar, belirli görevlerde, örneğin İddia Doğrulama görevinde, araçlı ajanların 0.62’lik ortalama puanına çok yakın bir puan olan 0.61 puanla, neredeyse araçlı araştırma ajanları kadar iyi performans gösterdiler. Bu, o3 ve Claude gibi modellerin güçlü dahili ön yargıları olduğunu ve ortak iddiaların doğruluğunu web aramasına gerek kalmadan tanıyabildiklerini gösteriyor.
Ancak, daha zorlu görevlerde – örneğin, birden fazla kaynaktan değerleri birleştirmeyi gerektiren Sayı Bulma veya bağlam içinde çeşitli gerçekleri bulup değerlendirmeyi gerektiren Delil Toplama görevlerinde, bu araçsız modeller tamamen başarısız oldular. Taze bilgiler veya gerçek zamanlı arama yetenekleri olmadan, doğru veya kapsamlı cevaplar üretebilecek araçlardan yoksundular.
Bu karşıtlık, önemli bir nüansı vurguluyor: günümüzün LLM’leri çok şey “biliyor” gibi görünebilir, ancak derin araştırma sadece hatırlamaya değil, güncel ve doğrulanabilir bilgilerle akıl yürütmeye dayanır – bu, yalnızca araç destekli ajanlar tarafından gerçekten sağlanabilir.
Son Düşünceler
DRB raporu, günümüzün en iyi AI ajanlarının, dar olarak tanımlanmış görevlerde ortalama insanları geçebildiklerini ancak yetenekli, genelci araştırmacılardan – özellikle stratejik planlama, adaptasyon ve nüanslı akıl yürütme konularında – hala geri kaldıklarını net bir şekilde ortaya koyuyor.
Bu fark, özellikle uzun veya karmaşık seanslar sırasında daha da belirgin hale geliyor – burada bir ajan, görevin amacını yavaş yavaş kaybetmeye başlar, bu da tutarlılık ve fayda açısından can sıkıcı bir bozulmaya yol açar.
Derin Araştırma Bench’in değerli olmasının nedeni, sadece yüzey düzeyindeki bilgiyi test etmemesi, aynı zamanda araç kullanımı, hafıza, akıl yürütme ve adaptasyonun kesişimini sorgulaması ve gerçek dünya araştırmalarına MMLU veya GSM8k gibi referans noktalarına göre daha yakın bir analog sunmasıdır.
LLM’ler ciddi bilgi işlerine entegre etmeye devam ettikçe, FutureSearch gibi araçlar DRB, bu sistemlerin ne kadar iyi çalıştığını değerlendirmek için, sadece ne bildiklerini değil, nasıl çalıştıklarını da değerlendirmek için gereklidir.












