Görüş

Jev ve AI Ajanları için Yeni Karar Katmanı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Neden System One modelleri hızlı kararı yavaş akıldan ayırabilir

Birçok AI ajanı neredeyse tüm kararları için bir dil modeli kullanır. Dil modeli bir araç seçer, sonuçları değerlendirir, devam etmesi gerekip gerekmediğini belirler ve sonunda yanıtlar üretir. Esnek; ancak bu süreç, evet‑hayır kararları ölçekli olarak tekrarlandığında maliyetli olabilir. Unite.AI daha önce ajan tabanlı iş akışlarının model çağrılarını, bağlamı ve yeniden denemeleri artırdığını tartışmıştı. Her ek karar, kullanıcılara faydalı bilgi sağlanmadan önce zaman ve para ekleyebilir.

Jev görevi farklı bir şekilde bölmeyi önerir. Yanıt kümesinin tanımlı olduğu sınırlı yargılar için tasarlanmış bir model kullanın. Açık uçlu akıl yürütme ve dil için üretken bir model kullanın. Jev, burada temel düşüncenin tüm ajanların yeni bir ürün satın alması gerektiği değil, olduğunu öne sürer. Ana kavram, bir ajanın her noktada aynı tür zekaya ihtiyaç duymadığıdır.

Jev Gerçekte Ne Yapar

TypeSafe, Jev’i Eylül 2026’da piyasaya sürdü, yeni System One modellerinin ilki. Jev metin üretmez. Bunun yerine ona bir durum (örneğin bir destek mesajı ve kullanıcı verisi) gönderirsiniz. Ayrıca önceden tanımlanmış yanıt türlerine sahip bir veya daha fazla soru gönderirsiniz. Sonra Jev, tiplenmiş yanıtlar ve olasılıklarla yanıt verir.

Şirketin resmi belgelerine göre şirketin resmi belgeleri, yargılamak için üç temel öğe vardır:

  • Choice önceden tanımlanmış seçenekler arasından seçim yapmanıza olanak tanır.
  • Score bir şeyi sıralı bir rubriğe göre puanlamanıza olanak tanır.
  • Noul bir ifadenin doğru olma olasılığını tahmin eder.

Aynı durum hakkında bir istek içinde birden fazla bağımsız soru sorabilirsiniz.

Örneğin, bir müşteri hizmetleri sorunu ile ilgilendiğinizi varsayalım. Bir sistem, bu vakayı hangi ekibin ele alması gerektiğini belirlemek isteyebilir. Ayrıca birinin ne kadar hızlı yanıt vermesi gerektiğini ve müşterinin iade talep edip etmediğini tespit edebilir.

Bir sohbet modeli potansiyel olarak bu üç görevi de yerine getirebilir. Ancak sonuçları uygulamanıza yapılandırılmış bir yanıt olarak geri sağlaması gerekir. Bunun aksine, Jev yalnızca bu sınırlı kararları sunar. Uygulamanız daha sonra bu kararlara dayanarak bir sonraki eylemi belirler.

Mimari Değişim Modelden Daha Önemli

Bu tartışmaların çoğu büyük modelleri küçüklerle karşılaştırır. Jev alternatif bir sınır önerir. Bazı adımlar dil üretimini içerir. Diğerleri ise yazılımın tüketebileceği dar kapsamlı kararlar içerir.

Bu, ajan içinde bir karar katmanı oluşturur. Model tahmin yapar. Yazılım politika uygular. Eğer tahmini olasılık test edilmiş bir eşiği aşar ve eylem düşük riskli ve geri alınabilir ise, iş akışı devam edebilir. Sonuçlarda belirsizlik varsa ya da eylem ciddi sonuçlar doğurabilecekse, sistem insan denetimi isteyebilir. Bir akıl yürütme modeli belirsizliği araştırmaya yardımcı olabilir, ancak gerekli insan onayının yerini almaz.

Şekil 1. Sınırlı bir karar yolu eşik değerlerini, izinleri ve yükseltmeleri kod içinde tutar.

Model yönlendirme ile benzerlikler vardır, ancak kritik bir fark vardır. RouteLLM iki dil modeli arasından seçim yapma konusunda kararlar verir. Kalite ve fiyatı dengelemek için daha güçlü ve daha zayıf model arasında seçim yapar. Bir System One modeli, kodun doğrudan kullanabileceği sınırlı kararlar üretir. Bu kararlar, model yönlendirmeyi ve bir ajan içindeki diğer kararları da destekleyebilir.

Neden Ajan Döngüleri Doğal Bir Uyum Sağlar

Ajan döngülerinin doğası, çok düşük seviyelerde çok sayıda karar vermek için onları özellikle uygun kılar. Bu kararlar nihai çıktıya ulaşmaya yardımcı olur. Başka bir deyişle, bir kullanıcı sorusunu veya isteğini gönderdiğinde ajanların çok sayıda \”küçük\” karar vermesi gerekir. Bu kararlar, yanıt veya çıktı geri dönmeden önce gerçekleşir.

Bir örnek, hangi araçların kullanılacağını, alınan kayıtların sıralanmasını ve riskin değerlendirilmesini belirlemek olabilir. Sistem ayrıca yeterli kanıt olup olmadığını ve sürecin devam edip etmeyeceğini belirler. Muhtemelen bunlar tekrarlı olarak gerçekleşecektir. Ayrıca, her döngü arasındaki gecikmeler zamanla birikebilir.

Bu ajan döngüleri rolü, LangChain’in Jev entegrasyonu, burada Jev hem model yönlendirmesini hem de araç çağrısı kontrollerini gerçekleştirebilir. Jev, üretken modelin kenarlarına entegre olurken, üretken model kendisi planlamaya ve içerik üretmeye devam eder. Bu, Jev için çok daha gerçekçi bir kullanım durumunu temsil eder. Genel amaçlı bir dil modelini tamamlar, onun yerine geçmez.

Ayrıca, soruları paralelleştirmek, ekiplerin görevleri bölme konusundaki düşünce biçimini de değiştirir. Özellikle, ekipler tek bir belirsiz talimatı birden fazla ayrı değerlendirme sorusuna ayırabilir. Bu, model çağrılarının çok daha kısa bir dizisine yol açabilir. Daha kolay değerlendirilebilen bir iş akışı oluşturabilir. Ayrıca geliştiricilerin ortaya çıkan yargıları birleştirmek için açık iş mantığını kullanmasına olanak tanır.

Genel amaçlı dil modelleri yapılandırılmış çıktı üretebilir ve bazı durumlarda daha iyi bir seçenek olabilir. Örneğin, bir karar ve bir açıklama birlikte sağlanması gerekebilir. Bu nedenle, Jev etkili sayılabilmesi için yalnızca şema uyumluluğundan daha fazlasını göstermelidir.

Jev’in etkinliği, genel sistem gecikmesinde azalma sağlamasına bağlıdır. Ayrıca faydalı olasılık tahminleri üretmesine ve çeşitli girdilerde performans istikrarı göstermesine dayanır. Jev bu faydaları sağlayamazsa, başka bir model seçmek sadece ek geliştirme ve operasyonel yük getirecektir.

Tiplenmiş Doğru Anlamına Gelir mi?

Jev hakkında iddialar yapılırken kullanılan dilin de dikkatli bir şekilde ifade edilmesi gerekir. Çıktı alanı önceden tanımlandığından, model uydurulmuş bir alan ya da ayrıştırılamaz bir paragraf döndürmemelidir. Bu, bir tür hatayı ortadan kaldırır; ancak anlamsal hatayı ortadan kaldırmaz. Bir sistemin yanlış bir departman döndürmesini, hatalı bir risk seviyesi atamasını ya da aşırı kesinlik beyan etmesini engelleyen bir şey yoktur. Bütün bunları tamamen tip-güvenli bir şekilde yapabilir.

TypeSafe’in kendi System One belgeleri önemli bir ayrım yapar. Kalibrasyon, tahmin grupları üzerinden ölçülür; tek bir tahminin doğruluğunu garanti etmez. Üretimde bunun sonuçları vardır. Takımlar, tahmin edilen olasılıkların kendi verilerindeki gözlemlenen sonuçlarla eşleşip eşleşmediğini test etmelidir.

Performans kanıtları hâlâ erken aşamada

TypeSafe rapor ediyor ki yanıt süreleri 70 ile 500 milisaniye arasında. Ayrıca, dahili iş akışı değerlendirmelerinde önemli maliyet tasarrufları ve hız iyileştirmelerine referans vermektedir. Ayrıca, TypeSafe bu başlık kazançlarının gerçek dünyadaki kazançların yüksek ucuna yakın olabileceğini belirtmektedir. TypeSafe’in herkese açık iş akışı testi diğer öncü modeller tarafından sağlanan referans olasılıkları, gerçek etiketler yerine kullanır. Sonuçlar hipotez oluşturmak için iyidir. Sonuçlar gerçek bir iş yüküne karşı bağımsız bir testi yerine geçemez.

Benimsemeden Önce Pratik Bir Test

İlk AI destekli karar iş akışınızı oluştururken, en kritik kararlarınızı (örneğin, tıbbi onaylar veya hesap askıya almaları) seçmeyin. Bunun yerine, ekipteki diğer kişiler tarafından kolayca incelenebilen, çok yaygın, geri döndürülebilir bir şey seçin. Bu, bilet yönlendirme, belge sınıflandırma, model seçimi ve düşük riskli kalite güvencesi gibi konuları içerir ancak bunlarla sınırlı değildir.

Dört soru, bunun işe yarayıp yaramayacağını değerlendirmenize yardımcı olacaktır:

  • Çıktının mümkün olan sınırlı sayıda yanıtı var mı?
  • Karar için kriterleri net bir şekilde ifade edebilir misiniz?
  • Ölçülebilir sonuçlar var mı?Tahmini, olasılığını, eylemi ve sonrasındaki sonuçları izleyin. Tahmin edilen olasılıkları gözlemlenen sonuçlarla karşılaştırarak kalibrasyonu düzenli olarak kontrol edin.
  • Otomatik karar süreci başarısız olursa alternatif bir planınız var mı?Bir akıl yürütme modeli kullanılması, daha fazla bilgi istenmesi veya bir insanın dahil edilmesi gerektiği belirli bir noktayı tanımlayın.

Analiziniz tüm iş akışını, karar verme sürecini de kapsamalıdır. Karar doğruluğu, çekilme veya yükseltme oranları, toplam uçtan uca işleme süresi, başarılı bir şekilde tamamlanan görev başına maliyet ve hataların etkisi gibi ölçütleri kullanın. Zorlu koşullarda testler yürütün: kelime kullanımındaki değişiklikler, ilgili verilerin atlanması, nadir kategoriler ve adversarial girdiler. Aşağı akışta ek maliyetler yaratan optimize edilmiş bir sınıflandırıcı bir optimizasyon değildir.

Buradaki Uzun Vadeli Ders

Jev başarılı olursa, önemli ölçüde değişirse veya hızla yerine geçilirse, bir şey sabit kalır. Mimari soru devam eder. Her makine temelli kararın üretilecek dil olarak sunulması gerekli mi?

Birçok durumda cevap “no”dır. Üretim ortamında, üretken modeller kullanan bir sistem yorumlar, planlar ve açıklamalar üretebilir. Sınırlı karar modelleri kullanılarak aynı sistem yönlendirme, puanlama ve geçiş yapabilir. Kod, kabul edilebilir eşik değerlerini ve izinleri belirlemeye devam edebilir. İnsanlar, başkalarının hayatını etkileyen kararların sorumluluğunu üstlenmelidir.

Bu, tek bir otonom modelin tüm görevleri güvenilir bir şekilde yerine getirmesinden daha az çarpıcı bir bakış açısı olsa da, güvenilir sistemlerin nasıl oluşturulduğunu yansıtır. Ajanlar için bir sonraki performans ilerlemesi, sistemde düşünmenin daha uzun sürdüğü alanların seçilmesine bağlı olabilir. Diğer alanlar hızlı kararlar gerektirir ve bazıları hiç eylem gerektirmez.

Himanshu Goel, yapay zeka ve makine öğrenimi alanında yüksek riskli alanlar için geri çağırma güçlendirilmiş nesil konusunda uzmanlaşmış bir araştırmacıdır, bunlar arasında biyomedikal, finansal ve düzenleyici belge iş akışları bulunmaktadır.