Yapay zeka modelleri ve platformları

Niyetten Yürütmeye: Microsoft’un Büyük Dil Modellerini Eylem Odaklı AI’ye Dönüştürmesi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Büyük Dil Modelleri (LLM’ler), doğal dil işleme şeklimizi değiştirdi. Sorulara cevap verebilir, kod yazabilir ve sohbet edebilirler. Ancak, gerçek dünya görevlerinde eksik kalırlar. Örneğin, bir LLM bir ceket satın alma konusunda size rehberlik edebilir, ancak siparişi sizin adınıza veremez. Düşünme ve yapma arasındaki bu boşluk, büyük bir sınırlamadır. İnsanlar sadece bilgiye ihtiyaç duymazlar, sonuçlar isterler.

Bu boşluğu kapatmak için Microsoft (MSFT ), LLM’leri eylem odaklı AI ajanlarına dönüştürüyor. Onları planlama, görevleri bölme ve gerçek dünya etkileşimlerine katılma yetenekleri kazandırarak, LLM’leri pratik görevleri etkili bir şekilde yönetmeye güçlendiriyor. Bu dönüşüm, LLM’lerin neler yapabileceğini yeniden tanımlama potansiyeline sahiptir ve onları karmaşık iş akışlarını otomatikleştiren ve günlük görevleri basitleştiren araçlara dönüştürebilir. Bu gerçekleşmesi için必要 olan şeylere ve Microsoft’un bu sorunu nasıl ele aldığına bakalım.

LLM’lerin Eylem Görmesi İçin Gerekenler

LLM’lerin gerçek dünyada görevleri gerçekleştirmesi için, metni anlama ötesine geçmeleri gerekir. Dijital ve fiziksel ortamlarla etkileşime girmeleri ve değişen koşullara uyum sağlamaları gerekir. Bunlara ihtiyaç duydukları bazı yetenekler:

  1. Kullanıcı Niyetini Anlama

Etkili bir şekilde eylem gerçekleştirmeleri için, LLM’lerin kullanıcı taleplerini anlamaları gerekir. Metin veya ses komutları gibi girdiler souvent belirsiz veya eksik olabilir. Sistem, bu boşlukları doldurmak için bilgisini ve talebin bağlamını kullanmalıdır. Çok adımlı sohbetler, bu niyetlerin netleştirilmesine yardımcı olabilir, böylece AI önce eylem gerçekleştirmeden önce anlar.

  1. Niyetleri Eylemlere Dönüştürme

Bir görevi anladıktan sonra, LLM’lerin bunu gerçekleştirebilir adımlara dönüştürmeleri gerekir. Bu, düğmeler tıklatma, API’leri çağırma veya fiziksel cihazları kontrol etme olabilir. LLM’lerin, görevin spesifiklerine göre eylemlerini uyarlamaları ve ortaya çıkan sorunları çözmeleri gerekir.

  1. Değişikliklere Uyum Sağlama

Gerçek dünya görevleri her zaman planlandığı gibi gitmez. LLM’lerin sorunları öngörmesi, adımları ayarlaması ve ortaya çıkan sorunlarda alternatifler bulması gerekir. Örneğin, gerekli bir kaynak yoksa, sistem başka bir şekilde görevi tamamlamalıdır. Bu esneklik, sürecin değişikliklerde durmamasını sağlar.

  1. Belirli Görevlerde Uzmanlaşma

LLM’ler genel kullanıma yönelik tasarlanmış olsalar da, uzmanlaşma onları daha verimli kılar. Belirli görevlere odaklanarak, bu sistemler daha iyi sonuçlar elde edebilir ve daha az kaynak kullanabilir. Bu, özellikle sınırlı hesaplama gücüne sahip cihazlar gibi akıllı telefonlar veya gömülü sistemler için önemlidir.

Bu becerileri geliştirerek, LLM’ler sadece bilgi işlemekten öteye geçebilir. Anlamlı eylemler gerçekleştirebilir ve AI’nin günlük iş akışlarına sorunsuz bir şekilde entegre olmasını sağlayabilir.

Microsoft’un LLM’leri Dönüştürmesi

Microsoft’un eylem odaklı AI oluşturma yaklaşımı, yapılandırılmış bir sürece dayanır. Ana hedef, LLM’lerin komutları anlamasını, etkili bir şekilde planlamasını ve eylem gerçekleştirmesini sağlamaktır. İşte bunu nasıl yaptıkları:

1. Adım: Veri Toplama ve Hazırlama

İlk aşamada, belirli kullanım durumlarına ilişkin verileri topladılar: UFO Ajanı (aşağıda açıklanmıştır). Toplanan veriler, kullanıcı sorguları, ortam ayrıntıları ve görevle ilgili eylemleri içerir. Bu aşamada iki tür veri toplanır: ilk olarak, LLM’lerin yüksek düzeyde görev adımlarını belirlemesine yardımcı olan görev planı verileri toplanır. Örneğin, “Word’de yazı tipi boyutunu değiştir” görevi, metni seçme ve araç çubuğu ayarlarını ayarlama adımlarını içerebilir. İkinci olarak, görev eylem verileri toplanır, bu da LLM’lerin bu adımları kesin talimatlara dönüştürmesini sağlar, Örneğin, belirli düğmeleri tıklatma veya klavye kısayollarını kullanma.

Bu kombinasyon, modelin hem büyük resmi hem de görevleri etkili bir şekilde gerçekleştirmek için gereken ayrıntılı talimatları sağlar.

2. Adım: Model Eğitimi

Veriler toplandıktan sonra, LLM’ler birden fazla eğitim oturumuyla rafine edilir. İlk adımda, LLM’ler görev planlaması için eğitilir ve kullanıcı taleplerini gerçekleştirebilir adımlara ayırması öğretilir. Uzman tarafından etiketlenmiş veriler, bu planları spesifik eylemlere dönüştürme yeteneklerini öğretmek için kullanılır. Problemleri çözme yeteneklerini daha da geliştirmek için, LLM’ler kendi kendine güçlendirme keşif sürecine katılırlar ve çözülmemiş görevlerle başa çıkmak ve sürekli öğrenme için yeni örnekler üretmek için güçlendirilirler. Son olarak, pekiştirme öğrenimi uygulanır ve başarılar ve başarısızlıklardan gelen geri bildirimler, karar verme yeteneklerini daha da geliştirmek için kullanılır.

3. Adım: Çevrimdışı Test

Eğitimden sonra, model kontrol edilen ortamlarda test edilir ve güvenilirliği garantilenir. Görev Başarı Oranı (TSR) ve Adım Başarı Oranı (SSR) gibi metriklere dayanarak performansı ölçülür. Örneğin, bir takvim yönetim ajanının testi, hatalar olmadan toplantıları planlayabilme ve davetiye gönderebilme yeteneğini doğrulamayı içerebilir.

4. Adım: Gerçek Sistemlere Entegrasyon

Doğrulandıktan sonra, model bir ajan çerçevesine entegre edilir. Bu, gerçek dünya ortamlarıyla, düğmeleri tıklatma veya menüleri gezme gibi, etkileşime girmesini sağlar. UI Otomasyon API’leri gibi araçlar, sistemlerin kullanıcı arayüzü öğelerini dinamik olarak tanımlamasına ve manipüle etmesine yardımcı olur.

Örneğin, bir görev Word’de metni vurgulamayı içeriyorsa, ajan vurgulama düğmesini tanımlar, metni seçer ve biçimlendirmeyi uygular. Bir bellek bileşeni, LLM’nin geçmiş eylemlerini takip etmesini ve yeni senaryolara uyum sağlamasını sağlayabilir.

5. Adım: Gerçek Dünya Testi

Son adım, çevrimiçi değerlendirme aşamasıdır. Burada, sistem gerçek dünya senaryolarında test edilir ve beklenmedik değişikliklere ve hatalara karşı dayanıklılığını garantilemek için değerlendirilir. Örneğin, bir müşteri destek botu, parolayı sıfırlama konusunda kullanıcıları yönlendirebilir ve yanlış girişlere veya eksik bilgilere karşı uyum sağlayabilir. Bu test, AI’nin günlük kullanıma hazır ve dayanıklı olduğunu garantiler.

Pratik Bir Örnek: UFO Ajanı

Eylem odaklı AI’nin nasıl çalıştığını göstermek için Microsoft, UFO Ajanını geliştirdi. Bu sistem, Windows ortamlarında gerçek dünya görevlerini gerçekleştirmek üzere tasarlandı ve kullanıcı taleplerini tamamlanmış eylemlere dönüştürdü.

Temelinde, UFO Ajanı bir LLM kullanır ve talepleri yorumlar, eylemleri planlar. Örneğin, bir kullanıcı “Bu belgedeki ‘önemli’ kelimesini vurgula” derse, ajan Word ile etkileşime girer ve görevi tamamlar. Bağlamsal bilgileri toplar, UI kontrollerinin konumunu belirler ve eylemleri planlar ve gerçekleştirir.

UFO Ajanı, Windows UI Otomasyon (UIA) API’si gibi araçlara dayanır. Bu API, uygulamaları kontrol öğeleri için taramak üzere kullanılır, Örneğin, “Belgeyi PDF olarak kaydet” görevi için “Dosya” düğmesini tanımlar, “Farklı Kaydet” seçeneğini bulur ve gerekli adımları gerçekleştirir. Verileri tutarlı bir şekilde yapılandırarak, sistem eğitimden gerçek dünya uygulamasına kadar sorunsuz bir işleyişi garantiler.

Engelleri Aşmak

Bu gelişme heyecan verici olsa da, eylem odaklı AI oluşturmak zorluklar içerir. Ölçeklenebilirlik önemli bir sorun teşkil eder. Bu modelleri çeşitli görevler için eğitmek ve dağıtmak önemli kaynaklar gerektirir. Güvenilirlik ve güvenlik de eşit derecede önemlidir. Modellerin görevleri istenmeyen sonuçlar olmadan gerçekleştirmesi gerekir, özellikle de hassas ortamlarda. Ayrıca, bu sistemlerin özel verilere etkileşime girdiği için, gizlilik ve güvenlik konularında etik standartları korumak da önemlidir.

Microsoft’un yol haritası, verimliliği artırmaya, kullanım örneklerini genişletmeye ve etik standartları korumaya odaklanıyor. Bu ilerlemelerle, LLM’ler AI’nin dünya ile etkileşim şeklini yeniden tanımlayabilir, daha pratik, uyumlu ve eylem odaklı hale getirebilir.

AI’nin Geleceği

LLM’leri eylem odaklı ajanlara dönüştürmek bir dönüm noktası olabilir. Bu sistemler görevleri otomatikleştirebilir, iş akışlarını basitleştirebilir ve teknolojiyi daha erişilebilir hale getirebilir. Microsoft’un eylem odaklı AI ve UFO Ajanı gibi araçlar üzerindeki çalışmaları sadece başlangıç. AI ilerledikçe, daha akıllı, daha yetenekli sistemler bekleyebiliriz; bunlar sadece bizimle etkileşime geçmez, işleri halleder.

Dr. Tehseen Zia, COMSATS Üniversitesi Islamabad'da görev yapan bir Öğretim Üyesi olup, Viyana Teknoloji Üniversitesi'nden (Avusturya) Yapay Zeka alanında doktora sahiptir. Yapay Zeka, Makine Öğrenimi, Veri Bilimi ve Bilgisayarlı Görü alanında uzmanlaşmış olan Dr. Tehseen, saygın bilimsel dergilerde yayımlanmış önemli katkılarıyla dikkat çekmiştir. Dr. Tehseen ayrıca çeşitli endüstriyel projelerin Baş Araştırma Görevlisi olarak görev yapmış ve Yapay Zeka Danışmanı olarak hizmet vermiştir.