Düşünce Liderleri

Büyük Dil Modellerinde Eski Olan Gerçekler Nasıl Taze Tutulur?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Büyük Dil Modelleri (LLM) gibi GPT3, ChatGPT ve BARD günümüzde herkesin konuştuğu konular. Bu araçların toplum için iyi veya kötü olup olmadığı ve AI geleceği için ne anlama geldiği hakkında herkesin bir görüşü var. Google, yeni modeli BARD’ın kompleks bir soruyu yanlış cevaplaması (küçük bir hata) nedeniyle çok eleştiri aldı. “James Webb Uzay Teleskobu’ndan 9 yaşındaki çocuğuma anlatabileceğim yeni keşifler nelerdir?” sorusuna verilen cevapların üçü vardı ve bunlardan ikisi doğru, biri yanlışydı. Yanlış olan cevap, ilk “exoplanet” resminin JWST tarafından çekildiği yönündeydi, ki bu doğru değildi. Temel olarak, modelin bilgi tabanında yanlış bir gerçek vardı. Büyük dil modellerinin etkili olması için, bu gerçekleri güncellemek veya yeni bilgilerle zenginleştirmek için bir yol bulmalıyız.

Önce, büyük dil modellerinin (LLM) içinde nasıl gerçekleri depoladığını görelim. Büyük dil modelleri, geleneksel olarak veritabanları veya dosyalar gibi bilgi ve gerçekleri depolamazlar. Bunun yerine, büyük miktarda metin verisi üzerinde eğitilmişler ve bu verilerdeki kalıpları ve ilişkileri öğrenmişlerdir. Bu, insan benzeri cevaplar üretmelerine olanak tanır, ancak öğrenilen bilgilerinin özel bir depolama yeri yoktur. Bir soru sorulduğunda, model aldığı girdi temelinde bir cevap üretir. Dil modelinin sahip olduğu bilgi ve kavrayış, öğrenilen kalıpların ve ilişkilerin bir sonucu olarak ortaya çıkar, modelin belleğinde açıkça depolanmaz. Modern LLM’lerin temelini oluşturan Transformers mimarisi, sorulara cevap verirken kullanılan iç gerçek kodlamasına sahiptir.

Eğer LLM’nin iç belleğindeki gerçekler yanlış veya eskimişse, yeni bilgi bir промпт aracılığıyla sağlanmalıdır. Промпт, LLM’ye gönderilen metin, sorgu ve destekleyici kanıtları içerir ve bu, yeni veya düzeltilmiş gerçekler olabilir. Bunu yapmak için 3 yol vardır.

1. LLM’nin kodlanmış gerçeklerini düzeltmek için bir yol, bir dış bilgi tabanından bağlamla ilgili yeni gerçekleri sağlamaktır. Bu bilgi tabanı, ilgili bilgileri almak için API çağrıları veya SQL, No-SQL veya Vektör veritabanlarına bakmak olabilir. Daha gelişmiş bilgi, veri varlıkları ve aralarındaki ilişkileri depolayan bir bilgi grafından çıkarılabilir. Kullanıcı sorguladığı bilgilere bağlı olarak, ilgili bağlam bilgileri alınabilir ve LLM’ye ek gerçekler olarak verilebilir. Bu gerçekler, öğrenme sürecini iyileştirmek için eğitim örneklerine benzer bir forma dönüştürülebilir. Örneğin, modelin nasıl cevaplar vereceğini öğrenmesi için soru-cevap çiftleri geçebilirsiniz.

2. LLM’yi daha da yenilemek (ve daha pahalı) bir yol, gerçek fine-tuning kullanarak eğitim verilerini kullanmaktır. Yani, belirli gerçekleri eklemek için bilgi tabanını sorgulamak yerine, bu bilgileri içeren bir eğitim verisi oluştururuz. Denetimli öğrenme teknikleri gibi fine-tuning kullanarak, bu ek bilgiye dayalı yeni bir LLM sürümü oluşturabiliriz. Bu süreç genellikle pahalıdır ve OpenAI’de fine-tune edilmiş bir model oluşturmak ve bakımını yapmak birkaç bin dolar maliyeti olabilir. Tabii ki, maliyet zamanla düşmesi beklenmektedir.

3. Bir başka seçenek, Peşin Öğrenme (RL) gibi yöntemleri kullanarak, insan geri bildirimi ile bir ajanı eğitmek ve soru cevaplama politikasını öğrenmektir. Bu yöntem, belirli görevlerde iyi olan daha küçük ayak izi modeller oluşturmak için son derece etkili olmuştur. Örneğin, OpenAI tarafından yayınlanan ünlü ChatGPT, insan geri bildirimi ile denetimli öğrenme ve RL’nin bir kombinasyonu ile eğitilmiştir.

Özetle, bu hızlı bir şekilde gelişen bir alan ve her büyük şirket bu alanda farklılaşma göstermek istiyor. Yakında, perakende, sağlık ve bankacılık gibi birçok alanda, insan benzeri şekilde cevap verebilen ve dilin nüanslarını anlayan büyük LLM araçlarını göreceğiz. Bu LLM güçlendirilmiş araçlar, şirket verisiyle entegre edildiğinde, erişimi basitleştirecek ve doğru verileri doğru insanlara doğru zamanda sunabilecektir.

Dattaraj Rao, Persistent Systems'da Baş Veri Bilimcisi, “Keras to Kubernetes: The Journey of a Machine Learning Model to Production” kitabının yazarıdır. Persistent Systems'da Dattaraj, Bilgisayar Görme, Doğal Dil Anlama, Olasılıksal programlama, Peşin Öğrenme, Açıklanabilir AI vb. gibi son teknoloji algoritmalarını araştıran ve Sağlık, Bankacılık ve Endüstriyel alanlarda uygulanabilirliğini gösteren AI Araştırma Laboratuvarını yönetmektedir. Dattaraj'ın Makine Öğrenimi ve Bilgisayar Görme alanında 11 patenti bulunmaktadır.