Prompt Mühendisliği
Büyük Dil Modelleri ile Geliştirilmiş Metin Gömme Eğitimleri

Metin gömme, kelimelerin, cümlelerin, paragrafların veya belgelerin anlamsal anlamını yakalayan vektör temsilidir. Bunlar, günümüzde bilgi geri çağırma, soru-cevap, anlamsal arama ve daha fazlası dahil olmak üzere birçok doğal dil işleme (NLP) uygulamasının temel bir bileşenidir.
GPT-3 gibi büyük dil modellerindeki recent gelişmeler, az örnek öğrenme ve doğal dil oluşturma konularında etkileyici yetenekler göstermiştir. Bu modelleri metin gömme alanını da geliştirmek için kullanabilir miyiz? Microsoft’tan araştırmacılar, “Büyük Dil Modelleri ile Metin Gömme Geliştirme” adlı makalelerinde, büyük dil modelleriyle sentetik eğitim verisi oluşturup bunu ince ayarlayarak süperior sonuçlar elde eden yeni bir yöntem öneriyorlar.
Mevcut Yöntemlerle İlgili Zorluklar
Geleneksel metin gömme teknikleri, kelime vektörlerinin ağırlıklı ortalamaları veya TF-IDF, metin içindeki zengin bağlamsal bilgiyi yeterince yakalayamaz. Daha yeni yöntemler, BERT gibi önceden eğitilmiş dil modellerine dayanır ve daha iyi bağlamsal farkındalığa sahip gömmeleri elde eder.
Ancak, bunlar karmaşık çok aşamalı eğitim boru hatlarına ihtiyaç duyar:
- Milyarlarca zayıf etiketli veya yapay metin çiftlerine önceden eğitim
- Sınırlı el ile düzenlenmiş veri setlerine ince ayar
Bu, büyük miktarda hesaplama kaynağı ve veri toplama için insan çabası gerektirir. Eğitim verisi, çeşitlilik ve dil kapsamında sınırlıdır. Örneğin, BEIR benchmarkı yalnızca İngilizce için 15 geri çağırma görevi için veri setlerini içerir.
Mevcut yöntemler chủ olarak daha küçük BERT tarzı mimarileri temel model olarak kullanır. Daha gelişmiş büyük dil modelleri ve ilgili tekniklerden yararlanamazlar.
Yöntem: Büyük Dil Modelleri ile Sentetik Veri Oluşturma
Bu sınırlamaları aşmak için, araştırmacılar GPT-3 ve GPT-4 gibi büyük dil modellerini kullanarak çeşitli sentetik eğitim verisi oluşturmak için yeni tek aşamalı bir eğitim yaklaşımı öneriyorlar.
Ana adımlar şunlardır:
- Görev Taksonomisi: Metin gömme görevlerini aşağıdaki gibi kategorilere ayırarak bir taksonomi tanımlayın:
- Asimetrik görevler (sorgu ve belge birbirinin eş anlamlı değil, örneğin arama)
- Simetrik görevler (sorgu ve belge birbirinin eş anlamlı, örneğin anlamsal benzerlik)
- Prompt Tasarımı: Her görev türüne uygun.prompt şablonları oluşturun ve büyük dil modelini ilgili eğitim örnekleri üretmeye yönlendirin.
- Sentetik Veri Oluşturma: Tasarlanan promptları kullanarak büyük dil modelini, çeşitli anlamsal görevleri kapsayan yüz binlerce (sorgu, belge) çifti üretin.
- Model Eğitimi: Güçlü, açık kaynaklı bir büyük dil modelini sentetik verilere ince ayarlayarak, karşıtlık kaybı kullanarak eğitin.
Bu yöntem, insan etiketleme çabası olmadan, çeşitli görevler ve diller için bol miktarda eğitim verisi oluşturmayı sağlar. Büyük dil modellerinin önceden web ölçekli corpora üzerinde eğitilmiş bilgilerini kullanarak, yüksek kaliteli veri oluşturabilirsiniz.
Araştırmacılar, bunu 2 adımlı bir prompting stratejisiyle gösteriyorlar:
- GPT-4’ü potansiyel geri çağırma görevlerini önermeye yönlendirin
- Önerilen görevlere dayalı (sorgu, belge) örneklerini üretmesi için GPT-4’ü tekrar yönlendirin
Prompt tasarımı ile ilgili bazı önemli noktalar:
- İnsan benzeri talimatlar için doğal dil promptları
- Çeşitliliği teşvik etmek için yer tutucular (örneğin, sorgu uzunluğu, açıklık, belge uzunluğu)
- Aynı görev türü için birden fazla şablonun birleştirilmesi
- Kaynak kullanılabilirliğine göre dillerin ağırlıklandırılması
Toplamda, 93 dilde, çeşitli anlamsal görevleri kapsayan 500.000 metin gömme örneği ürettiler. Baskın dil İngilizceydi (%43), onu Lehçe, Japonca, İtalyanca ve diğerleri izledi.
Model eğitimi için, daha küçük BERT tarzı mimariler yerine, açık kaynaklı 7B parametreli Mistral modelini ince ayarlayarak eğitmeyi tercih ettiler. Mistral zaten web ölçekli corpora üzerinde önceden eğitilmişti, bu nedenle ek karşıtlık öncül eğitimi gerekmedi. Buna eklenmesi ihmal edilebilir iyileşmeler sağladı.
Tüm ince ayar less than 1k adımda tamamlandı ve sentetik ve insan etiketli verilerin bir karışımını kullandı. Bu, önerilen yaklaşımın örnek verimliliğini gösteriyor.
Sonuçlar
Araştırmacılar, modelini MTEB benchmarkı üzerinde değerlendirdiler. Bu, sınıflandırma, kümeleme, anlamsal benzerlik, özetleme ve bilgi geri çağırma dahil çeşitli görevleri kapsar.
Modeli, önceki en iyi sonuçları 2.4 puan ortalama puanla geride bıraktı ve neredeyse her kategoride yeni rekorlar kurdu:
| Model | Önceki En İyi Sonuç | Önerilen Model |
|---|---|---|
| Sınıflandırma | 76.0 | 78.5 |
| Kümeleme | 46.1 | 50.3 |
| Çift Sınıflandırma | 87.1 | 88.3 |
| Yeniden Sıralama | 60.0 | 60.2 |
| Geri Çağırma | 54.3 | 56.9 |
| STS | 83.1 | 84.6 |
| Özetleme | 31.6 | 31.4 |
| Ortalama | 64.2 | 66.6 |
Şaşırtıcı bir şekilde, yalnızca sentetik verilere dayalı olarak eğitim görerek ve hiçbir insan etiketli verisi kullanmayarak, rekabetçi bir doğruluk elde etti – tam olarak denetimli modelden sadece 3.5 puan geride.
Araştırmacılar, modelini ayrıca 18 dili kapsayan multilingual MIRACL benchmarkı üzerinde değerlendirdiler. Model, yüksek kaynaklı dillerde önceki en iyi sonuçları geride bıraktı, ancak düşük kaynaklı dillerde daha zayıftı. Düşük kaynaklı dillerde daha geniş ön eğitim ile bu sorunun hafifletilebileceğini öne sürdüler.
Özetle, büyük dil modelleri ile oluşturulan sentetik verilere dayalı metin gömme, yeni devlet sonuçlarını kurdu ve daha basit, daha verimli bir eğitim süreci sundu. Prompt mühendisliği ve sentetik veri kalitesi üzerine daha fazla araştırma ile bu yöntem, çok dilli metin gömme alanını büyük ölçüde geliştirebilir.
Analiz
Bu çalışma, birkaç değerli çıkarımı sunar:
- GPT-3 ve GPT-4 gibi büyük dil modelleri, uygun bir şekilde yönlendirildiğinde, çeşitli NLP görevleri için yüksek kaliteli sentetik eğitim verisi oluşturma yeteneğine sahiptir. Bu, insan etiketli verilere olan bağımlılığı azaltabilir.
- Metin gömme için, Mistral gibi önceden eğitilmiş modellerde karşıtlık öncül eğitimi, yalnızca ince ayar ile karşılaştırıldığında ihmal edilebilir kazançlar sağlar. Bu, eğitim verimliliği hakkında önemli bir içgörüdür.
- Geri çağırma artırma yöntemleri, büyük dil modellerinin dış bilgiye dinamik olarak erişmesini sağlar. Bu nedenle, metin gömme alanını geliştirmek, bu modelleri de geliştirecektir.
- Düşük kaynaklı dillerde performansın geliştirilmesi önemlidir. Daha temsilcisi veri üzerinde eğitilmiş çok dilli büyük dil modelleri, bu açığı kapatmaya yardımcı olabilir.
- Kavramsal olarak, dil modelleme ve metin gömme, aynı madalyonun iki yüzüdür – dil anlamsal anlamını理解. Sentetik veri prompting ile, büyük dil modelleri, karmaşık boru hatları olmadan gömme olarak organik olarak ince ayarlanabilir.
Gelecek çalışma için bazı umut verici yönler:
- Açık kaynaklı büyük dil modellerini sentetik veri oluşturmak için kullanma
- Uzun bağlamlara adapte olmak için hafif post-eğitimi araştırma
- Kalite ve görev kapsamını kontrol etmek için prompt mühendisliği tekniklerinin geliştirilmesi
- Endüstriyel kullanım için çıkarım gecikmesi ve depolama maliyetlerini iyileştirme yöntemleri
Benchmarkları geçmekten öte, büyük dil modellerini metin gömme alanını geliştirmek için kullanmak, ilginç olanaklar sunar. Büyük dil modelleri, doğal dil üzerindeki hakimiyetlerini ilerlettikçe, yüksek kaliteli sentetik veri oluşturma yetenekleri de muhtemelen gelişecektir.
Ancak, bu potansiyeli gerçek dünya etkisine çevirmek için kritik araştırma yönleri kalır.
Özelleştirme ve Kontrol
Sentetik verinin bir avantajı, örnekleri spesifik gereksinimlere göre programlı olarak oluşturabilme yeteneğidir. Makalede gösterildiği gibi, prompt mühendisliği, yüz binlerce gömme görevi için eğitim verisi oluşturmayı sağlar.
Ancak, mevcut prompt tasarım uygulamaları daha çok bir sanat olarak kalıyor. Veri özelliklerini kesin bir şekilde kontrol etmek için sistematik, tekrar edilebilir yöntemlerin geliştirilmesi, bu tekniğin uygulanabilirliğini genişletecektir.
Örneğin, örneklerin karmaşıklığını, belirsizliğini ve yeniliğini değiştirmek için teknikler, aşağı akış görevlerinde dayanıklılık sorunlarını ele almaya yardımcı olabilir. Geri world dağılımlarına uymak için dinamik prompt oluşturma da açık bir zorluktur.
Ölçeklendirilmiş Eğitim
Önceden eğitilmiş büyük dil modelleri zaten önemli miktarda dil bilgisini kodlar, ancak sentetik veri oluşturma yetenekleri, daha fazla ölçeklenerek geliştirilebilir. Trilyonlarca token internet metinleri üzerinde eğitilmiş GPT-4 gibi modeller, güçlü az örnek öğrenme sergiler, ancak özel olarak eğitim verisi sentezlemek için optimize edilmemiştir.
Web ölçekli sentetik veri oluşturma için özel mimariler ve nesneler, bu yöntemin kalitesini ve verimliliğini önemli ölçüde geliştirebilir. Edinilmiş bilgiyi tamamlayıcı dış bilgi ile etkili bir şekilde entegre etmek de bir başka umut verici yöndür.
Çoklu Görev ve Çok Dilli
Makalede belirtildiği gibi, düşük kaynaklı dillerde performansı geliştirmek hala bir sorun olarak kalıyor. Tek bir büyük ölçekli büyük dil modeli yerine, belirli veri modellerine veya dil alanlarına uzmanlaşmış daha küçük uzman modellerinin bir filosunu eğitmek, bir alternatif olabilir.
Bu tür bir toplu yaklaşım, uzmanlar arasında öğrenilen temsil paylaşılarak, nadir görevler ve dillerde kapsamı geliştirebilir. Zaman içinde dil ve görev uzmanlığını genişletmek için sürekli öğrenme de heyecan verici bir perspektiftir.
Sonuç olarak, bu makale, büyük dil modellerinden sentetik eğitim verisi oluşturarak yüksek performanslı metin gömme oluşturmanın yenilikçi kavramını tanıtır. Sonuçları, bu yöntemin etkinliğini gösterir ve önceki benchmarkları geçer. Büyük dil modelleri ve sentetik veri teknikleri ilerledikçe, gömme eğitimi için bilgiyi kullanmak, çok umut verici bir yön haline gelebilir.















