Prompt Mühendisliği

Analog ve Step-Back İmlası: Google DeepMind’in Son Araştırma Çalışmalarına Bir Bakış

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Google DeepMind Prompt Engineering new Research

Giriş

İmla mühendisliği, büyük dil modellerine (LLM’ler) istenilen yanıtları üretmeleri için etkili imla yaratma üzerine odaklanıyor. İyi tasarlanmış bir imla, belirsiz veya yanlış bir yanıt ile kesin ve aydınlatıcı bir yanıt arasındaki farkı yaratabilir.

Geniş AI ekosisteminde, imla mühendisliği, dil modellerinden daha doğru ve bağlamsal olarak ilgili bilgi çıkarmak için kullanılan çeşitli yöntemlerden biridir. Diğer yöntemler arasında, modelin görevi anlamasına yardımcı olmak için birkaç örnek verilen few-shot öğrenme ve modelin daha küçük bir veri kümesinde daha fazla eğitim görmesi yoluyla yanıtlarını uzmanlaştıran fine-tuning bulunur.

Google DeepMind (GOOGL ), imla mühendisliğinin potansiyelini keşfetmeye devam eden AI topluluğunun bir parçası olarak, iki araştırma makalesi yayınladı.

Bu makaleler, dil modelleriyle iletişim kurma şeklimizi iyileştirmeye yönelik devam eden araştırmaların bir parçasıdır ve sorgu işleme ve veritabanı etkileşimi için imla yapısını iyileştirmeye yönelik yeni bakış açıları sunar.

Bu makale, bu araştırma makalelerinin ayrıntılarına girer, önerilen tekniklerin kavramlarını, metodolojilerini ve etkilerini açıklar ve bunları AI ve NLP’de sınırlı bilgiye sahip okuyucular için erişilebilir kılar.

Makale 1: Büyük Dil Modelleri olarak Analog Reasoner’lar

İlk makale, “Büyük Dil Modelleri olarak Analog Reasoner’lar” adlı bir çalışma sunar ve Analog İmla adlı yeni bir imla yaklaşımını tanıtır. Michihiro Yasunaga, Xinyun Chen ve diğer yazarlar, analog reasoner’lardan esinlenerek bir bilişsel süreç olan analog reasoner’lardan ilham alırlar.

Ana Kavramlar ve Metodoloji

Analog İmla, LLM’lerin bir problemi çözmeye başlamadan önce ilgili örnekler veya bilgiyi kendileri oluşturmalarını teşvik eder. Bu yaklaşım, etiketli örneklerin gereksizliğini ortadan kaldırır ve oluşturulan örneklerin her bir problem için uyarlanmasını sağlar.

Sol: Geleneksel yöntemler LLM'leri generic girdiler (0-shot CoT) veya etiketli örnekler (few-shot CoT) ile besler. Sağ: Yeni yaklaşım LLM'lerin problem çözmeden önce ilgili örnekler oluşturmasını sağlar ve etiketleme ihtiyacını ortadan kaldırır.

Sol: Geleneksel yöntemler LLM’leri generic girdiler (0-shot CoT) veya etiketli örnekler (few-shot CoT) ile besler. Sağ: Yeni yaklaşım LLM’lerin problem çözmeden önce ilgili örnekler oluşturmasını sağlar ve etiketleme ihtiyacını ortadan kaldırır.

Kendiliğinden Oluşan Örnekler

Makalede sunulan ilk teknik, kendiliğinden oluşan örneklerdir. Fikir, LLM’lerin eğitim sırasında edindikleri geniş bilgi birikimini kullanarak yeni problemleri çözmelerine yardımcı olmaktır. Süreç, hedef problemi, ilgili problemleri ve çözümlerini hatırlamasını veya oluşturmasını sağlayan talimatlarla zenginleştirmeyi içerir.

Örneğin, bir problem verildiğinde, model üç farklı ve ilgili problemi hatırlaması, açıklaması ve çözümlerini açıklaması talimatı verilir. Bu süreç, LLM’nin ilgili örnekleri üretmesini ve ilk problemi sorunsuz bir şekilde çözmelerini sağlar. İmla中的 ‘#’ sembollerinin kullanılması, yanıtın daha organize ve modelin takip etmesi daha kolay olmasını sağlar.

Makalede vurgulanan önemli teknik kararlar, ilgili ve çeşitli örneklerin oluşturulmasına odaklanma, tek geçişli bir yaklaşımın benimsenmesi ve üç ila beş örnek oluşturmanın en iyi sonuçları verdiğini göstermesi içerir.

Kendiliğinden Oluşan Bilgi + Örnekler

İkinci teknik, kod oluşturma gibi daha karmaşık görevlerde karşılaşılan zorlukları ele almak için kendiliğinden oluşan bilgi + örnekler olarak sunulur. Bu senaryolarda, LLM’ler alçak seviyeli örnekler üzerinde fazla odaklanabilir ve hedef problemleri çözerken genellemekte zorlanabilir. Bunu önlemek için, yazarlar, modelin temel kavramları tanımlamasını ve bir öğretici veya yüksek seviyeli çıkarımı sağlamasını teşvik eden ek bir talimat ile imlayı zenginleştirmeyi önerirler.

Bilgi ve örneklerin oluşturulma sırası kritik bir husustur. Yazarlar, bilgilerin örneklerden önce oluşturulmasının daha iyi sonuçlar verdiğini bulmuşlardır, çünkü bu, LLM’nin temel problem çözme yaklaşımlarına odaklanmasını sağlar.

Avantajlar ve Uygulamalar

Analog imla yaklaşımı several avantajlar sunar. Etiketli örnekler olmadan ayrıntılı reasoner örnekleri sağlar, 0-shot ve few-shot zincir düşünme (CoT) yöntemleriyle ilgili zorlukları ele alır. Ayrıca, oluşturulan örnekler, geleneksel few-shot CoT’ye kıyasla daha ilgili rehberlik sunar.

Makale, bu yaklaşımın çeşitli reasoner görevlerinde, matematik problem çözme, kod oluşturma ve BIG-Bench’de diğer reasoner görevlerinde etkinliğini gösterir.

Aşağıdaki tablolar, çeşitli imla yöntemlerinin farklı model mimarilerindeki performans ölçütlerini sunar. “Kendiliğinden Oluşan Örnekler” yöntemi, accuracy açısından diğer yöntemleri aşmaktadır. GSM8K accuracy’de, bu yöntem PaLM2 modelinde %81,7 gibi en yüksek performansı gösterir. Benzer şekilde, MATH accuracy’de GPT3.5-turbo’da %37,3 gibi en yüksek performansı gösterir.

Matematik görevlerinde performans, GSM8K ve MATH

Matematik görevlerinde performans, GSM8K ve MATH

İkinci tabloda, GPT3.5-turbo-16k ve GPT4 modelleri için “Kendiliğinden Oluşan Bilgi + Örnekler” en iyi performansı gösterir.

Codeforces kod oluşturma görevinde performans

Codeforces kod oluşturma görevinde performans

Makale 2: Bir Adım Geri Al: Büyük Dil Modellerinde Soyutlama Yoluyla Reasoner’ı Tetikleme

Genel Bakış

İkinci makale, “Bir Adım Geri Al: Büyük Dil Modellerinde Soyutlama Yoluyla Reasoner’ı Tetikleme” adlı bir çalışmayı sunar ve Step-Back İmlası adlı bir tekniği tanıtır. Yazarlar, Huaixiu Steven Zheng, Swaroop Mishra ve diğerleri, LLM’lerin reasoner yeteneklerini geliştirmeyi amaçlar ve onları doğru reasoner yolunu takip etmeye yönlendirmeyi hedefler.

STEP-BACK İMLASI, soyutlama ve reasoner aşamalarını gösteren bir diyagram

STEP-BACK İMLASI, soyutlama ve reasoner aşamalarını gösteren bir diyagram

Basit bir matematik sorusu kullanarak “Stepback Soru” tekniğini göstermek için bir örnek oluşturalım:

Orijinal Soru: Bir tren 60 km/h hızında seyahat eder ve 120 km mesafe kat ederse, bu kaç saat sürer?

Seçenekler:

3 saat
2 saat
1 saat
4 saat
Orijinal Cevap [Yanlış]: Doğru cevap 1).

Stepback Soru: Hız ve mesafe verildiğinde zamanı hesaplamak için temel formül nedir?

İlkeler:
Zamanı hesaplamak için formül:
Zaman = Mesafe / Hız

Final Cevap:
Formülü kullanarak, Zaman = 120 km / 60 km/h = 2 saat.
Doğru cevap 2) 2 saat.

Modern LLM’lerin bu soruyu kolayca cevaplayabileceği bilinse de, bu örnek, stepback tekniğinin nasıl çalışabileceğini göstermektedir. Daha zorlu senaryolarda, aynı teknik uygulanabilir.

MMLU-Kimya veri setinde STEP-BACK İMLASI

MMLU-Kimya veri setinde STEP-BACK İMLASI

Ana Kavramlar ve Metodoloji

Step-Back İmlası’nın özü, LLM’lerin büyük resmi görmelerini teşvik etmektir. Bu, LLM’lerin detaylara odaklanmak yerine daha yüksek seviyeli kavramları ve ilkeleri çıkarmalarını sağlar. Bu süreç, LLM’lerin problemi daha bilgilendirilmiş ve prensipli bir perspektiften ele almasına olanak tanır.

İlk adım, LLM’lerin verilen örneklerden detayları soyutlamasını teşvik etmektir. Bu adım, LLM’lerin problemi daha yüksek seviyeli kavramlar ve ilkeler üzerinden ele almasına olanak tanır.

Yüksek seviyeli kavramlar çıkarıldıktan sonra, bunlar LLM’leri çözüme doğru reasoner adımlarına yönlendirmek için kullanılır. Bu rehberlik, LLM’lerin mantıklı ve tutarlı bir yol izlemesini sağlar.

Yazarlar, Step-Back İmlası’nın etkinliğini doğrulamak için bir dizi deney yaparlar. Bu deneyler, PaLM-2L modellerini çeşitli zorlu reasoner görevlerinde test eder.

Görevler Across’ta Önemli İyileştirmeler

Sonuçlar etkileyicidir ve Step-Back İmlası’nın tüm görevlerde önemli performans kazançları sağladığını gösterir. Örneğin, bu teknik, MMLU Fizik ve Kimya’da PaLM-2L performansı %7 ve %11 oranında iyileştirir. Benzer şekilde, TimeQA’da %27 ve MuSiQue’de %7’lik iyileştirmeler sağlar.

STEP-BACK İMLASI'nın performansı

STEP-BACK İMLASI’nın performansı

Bu sonuçlar, Step-Back İmlası’nın LLM’lerin reasoner yeteneklerini önemli ölçüde geliştirebileceğini vurgular.

Sonuç

Her iki makale de, Google DeepMind tarafından sunulan yenilikçi imla mühendisliği yaklaşımlarını sunar. Analog İmla, analog reasoner kavramını kullanarak modellerin kendi örneklerini ve bilgilerini üretmesini teşvik eder. Step-Back İmlası ise soyutlama odaklı bir yaklaşım sunar ve modellerin yüksek seviyeli kavramları ve ilkeleri çıkarmasını teşvik eder.

Bu araştırma makaleleri, çeşitli alanlarda uygulanabilecek değerli bilgiler ve metodolojiler sağlar. İmla mühendisliği hakkında devam eden araştırmalarımızla, bu yaklaşımlar daha gelişmiş ve sofistike AI sistemlerine ulaşmak için kritik adımlar olarak hizmet eder.

Son beş yıldır Makine Öğrenimi ve Derin Öğrenme dünyasına kendimi adamış bulunuyorum. Tutkum ve uzmanlığım, özellikle AI/ML'ye odaklanarak 50'den fazla çeşitli yazılım mühendisliği projesine katkıda bulunmama yol açtı. Süregelen meraklılığım da beni Doğal Dil İşleme alanına yöneltti, bu alana daha da derinlemesine girmeye hevesliyim.