Yapay zeka modelleri ve platformları

Derin Takviye Öğrenimi Kullanarak Parafraz Oluşturma – Düşünce Liderleri

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Yazarken veya konuşurken hepimiz bir fikri başkalarına nasıl daha iyi ileteceğimizi merak etmişizdir. Hangi kelimeleri kullanmalıyım? Düşüncemi nasıl yapılandırmalıyım? Onlar nasıl yanıt verecekler? Phrasee‘de dil hakkında çok düşünürüz – ne işe yarar, ne işe yaramaz.

10 milyon kişilik listenize gönderilecek bir e-posta kampanyası için 20% indirimli yeni bir laptop için konu satırını yazıyorsanız hangisini seçerdiniz:

Hangi satırı seçerdiniz:

  • Siparişinize ekstra %20 indirim alabilirsiniz
  • Hazırlanın – ekstra %20 indirim

Aynı bilgiyi verirler ancak biri diğerine göre neredeyse %15 daha yüksek açılma oranına ulaştı (ve modelimizin hangisini seçeceğini tahmin edemezsiniz ?). Dil genellikle A/B testi veya çok kollu bantit ile test edilebilir, ancak otomatik olarak parafrazlar oluşturmak hala zor bir araştırma problemi.

İki cümle, birbirlerinin parafrazları olarak kabul edilir nếu aynı anlama sahip olup birbirlerinin yerine kullanılabiliyorlarsa. Makine tarafından oluşturulan bir cümlenin akıcı olması da genellikle göz ardı edilen bir diğer önemli şey.

Denetimli öğrenmeden farklı olarak, Takviye Öğrenimi (RL) ajanları, çevreleriyle etkileşime girerek ve buna karşılık olarak aldıkları ödülleri gözlemleyerek öğrenirler. Bu nüanslı fark, algoritmaların nasıl çalıştığı ve modellerin nasıl eğitildiği açısından büyük影响ler doğurur. Derin Takviye Öğrenimi, ajanın kompleks ortamlarda, örneğin Go, Atari ve StarCraft II gibi ortamlarda insanları geride bırakmayı öğrenmesine olanak tanıyan sinir ağlarını bir fonksiyon approximatoru olarak kullanır.

Bu başarıya rağmen, takviye öğrenimi gerçek dünya sorunlarına, özellikle Doğal Dil İşleme (NLP) sorunlarına yaygın olarak uygulanmamıştır.

MSc tezimde, derin RL’nin, girdi metinlerinin otomatik olarak parafrazlarını oluştururken denetimli öğrenme yöntemlerini nasıl geride bıraktığını gösterdik. En iyi parafrazı oluşturma problemi, cümleler arasındaki semantik benzerliği maksimuma çıkarırken çıktı dilbilgisini koruyan kelime dizisini bulma problemi olarak görülebilir. RL ajanları, kontrol ortamlarında maksimum beklenen ödülü elde etmek için en iyi eylem kümesini bulmaya uygunlardır.

Çoğu makine öğrenimi probleminin aksine, çoğu Doğal Dil Oluşturma (NLG) uygulamasındaki en büyük problem modellemede değil, değerlendirmede yatmaktadır. İnsan değerlendirmesi, hiện olarak NLG değerlendirmesinde altın standart olarak kabul edilmekle birlikte, pahalı, zaman alıcı, ayarlanması zor ve deneyler ve veri setleri arasında tekrarlanabilirlikten yoksun olma gibi önemli dezavantajlara sahiptir (Han, 2016). Buna karşılık, araştırmacılar, basit, genelleştirilebilir ve insan yargısını yansıtan otomatik ölçütlere uzun süredir ihtiyaç duymaktadırlar (Papineni et al., 2002).

Makine tarafından oluşturulan resim altyazılarının değerlendirilmesinde kullanılan en yaygın otomatik değerlendirme yöntemleri aşağıdaki gibidir:

Takviye Öğrenimi Kullanarak Parafraz Oluşturma İşlem Hattı

Yüksek kaliteli parafrazlar oluşturan bir sistem geliştirdik. Sistem, takviye öğrenimini hesaplama açısından verimli bir şekilde uygulamak için birden fazla adımdan oluşur. Yüksek düzeyli işlem hattının kısa bir özeti aşağıda verilmiştir ve daha fazla ayrıntı tezde bulunabilir.

Veri Kümesi

Araştırmada kullanılan beberapa parafraz veri kümesi bulunmaktadır. Bunlardan bazıları Microsoft Paraphrase corpus (MSFT ), ACL’nin Semantic Text Similarity yarışması, Quora Duplicate Questions ve Twitter Shared Links‘dir. Biz MS-COCO‘yu, büyüklüğü, temizliği ve iki önemli parafraz oluşturma makalesi için bir referans olarak kullanılması nedeniyle seçtik. MS-COCO, 5 farklı insan annotatörü tarafından her bir resim için 5 resim altyazısı bulunan 120k ortak sahne resmi içermektedir.

Bilgisayarlı görü görme araştırmaları için主要 olarak tasarlanmış olsa da, altyazılar genellikle yüksek semantik benzerliklere sahiptir ve ilginç parafrazlardır. Resim altyazıları farklı kişiler tarafından sağlandığı için, genellikle sahnedeki ayrıntılarda hafif varyasyonlara sahiptir, bu nedenle oluşturulan cümleler ayrıntılarda hayal gücü kurma eğilimindedir.

Denetimli Model

Takviye öğrenimi, örnek verimliliği, eğitim süreleri ve genel en iyi uygulamalar açısından önemli ölçüde iyileşmiştir, ancak RL modellerini sıfırdan eğitmek hala göreceli olarak çok yavaş ve istikrarsızdır (Arulkumaran et al., 2017). Bu nedenle, sıfırdan eğitmek yerine, önce bir denetimli modeli eğitiyoruz, ardından bunu RL ile iyileştiriyoruz.

Kodlayıcı-Çevirici model çerçevesini kullanıyoruz ve several temel denetimli modellerin performansını değerlendiriyoruz. Modeli RL ile iyileştirirken, yalnızca çevirici ağını iyileştiriyoruz ve kodlayıcı ağını statik olarak kabul ediyoruz. Buna göre iki temel çerçeve dikkate alınmaktadır:

  • Standart/vanilla kodlayıcı-çevirici ile GRU’lar kullanarak denetimli modeli sıfırdan eğitmek
  • Kodlayıcı için önceden eğitilmiş cümle gömme modellerini kullanmak, Bunlar arasında: havuzlanmış kelime gömmeleri (GloVe), InferSent ve BERT

Denetimli modeller genel olarak modeller boyunca benzer bir performans sergiler ve BERT ile vanilla kodlayıcı-çevirici en iyi performansı sergiler.

Performans genel olarak makul olsa da, üç ortak hata kaynağı vardır: kekeleme, cümle parçaları oluşturma ve hayal gücü kurma. Bu, RL kullanmanın çözmeye çalıştığı ana sorunlardır.

Takviye Öğrenimi Modeli

RL algoritmalarını uygulamak özellikle problemi çözebileceğinizden emin değilseniz çok zor olabilir. Ortamınızın, ajanınızın, hiperparametrelerinizin, ödül fonksiyonunuzun veya tüm bunların bir bileşiminin uygulamasında sorunlar olabilir. Bu sorunlar, derin RL yaparken ortaya çıkan sinir ağlarını hata ayıklamanın ek karmaşıklığıyla daha da artar.

Her türlü hata ayıklama gibi, basit başlamaktan önemlidir. RL algoritmalarını test etmek ve denetimli modelden bilgiyi aktarmak için bir strateji bulmak için iyi anlaşılan iki oyunculu RL ortamının (CartPole ve FrozenLake) varyasyonlarını uyguladık.

Actor-Critic algoritmasının bu ortamlarda REINFORCE’dan daha iyi performans gösterdiğini bulduk. Denetimli modelden aktarılan bilgiye dayanarak, eğitilen denetimli modelin ağırlıklarıyla aktörün ağırlıklarını başlatmak ve eleştirmeni önceden eğitmek en iyi performansı sağladı. Politika damıtma yaklaşımlarını yeni ortamlara genelleştirmenin çok zor olduğunu ve bunların çalışması için birçok yeni hiperparametrenin ayarlanması gerektiğini bulduk.

Bu bilgilerle desteklenerek, parafraz oluşturma görevi için bir yaklaşım geliştirmeye geçtik. İlk olarak bir ortam oluşturmamız gerekiyor.

Ortam, farklı değerlendirme ölçütlerini ödül fonksiyonları olarak kullanmanın etkilerini kolayca test etmemize olanak tanır.

Sonra ajanı tanımlarız, birçok avantajı nedeniyle aktör-eleştirmen mimarisini kullanırız. Aktör, dizideki sonraki kelimeyi seçmek için kullanılır ve eğitilen denetimli modelin ağırlıklarıyla başlatılır. Eleştirmen, bir durumun alacağı beklenen ödülün bir tahminini sağlar ve aktörün öğrenmesine yardımcı olur.

Doğru Ödül Fonksiyonunu Tasarlamak

RL sisteminin en önemli bileşeni ödül fonksiyonudur, çünkü RL ajanı bunu optimize etmeye çalışır. Ödül fonksiyonu yanlışsa, sonuçlar zarar görür, sistemdeki diğer tüm parçalar çalışsa bile.

Klasik bir örnek, CoastRunners‘dır, burada OpenAI araştırmacıları ödül fonksiyonunu yarışmayı kazanmak yerine toplam puanı maksimuma çıkarmak olarak ayarlar. Sonuç, ajanın yarışmayı tamamlamadan en yüksek puanı alabileceği bir döngüyü keşfetmesidir.

https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title

Parafrazların kalitesini değerlendirmek itself bir çözülmemiş problemken, bu nesneyi otomatik olarak yakalayan bir ödül fonksiyonunu tasarlamak daha da zordur. Dilin çoğu yönü, lineer metriklere güzel bir şekilde bölünmez ve görev bağımlıdır (Novikova et al., 2017).

RL ajanı, yüksek kaliteli metin oluşturmak yerine, değerlendirme ölçütünün zayıflıklarını sömüren ilginç bir strateji keşfeder. Bu, ajanın doğrudan optimize etmediği metriklere poor performanslara yol açar.

Üç ana yaklaşımı dikkate alıyoruz:

  1. Kelime-Çakışma Ölçütleri

Ortak NLP değerlendirme ölçütleri, oluşturulan parafraz ve değerlendirme cümlesi arasındaki kelime çakışması oranını dikkate alır. Çakışma ne kadar fazla olursa, ödül o kadar büyüktür. Kelime düzeyindeki yaklaşımların zorluğu, ajanın çok fazla bağlaç kelimesi gibi “a”, “is”, “on”, “of” içeriyor olması ve akıcılık ölçütünün olmamasıdır. Bu, çok düşük kaliteli parafrazlara yol açar.

  1. Cümle Düzeyi Benzerlik ve Akıcılık Ölçütleri

Oluşturulan parafrazın ana özellikleri, akıcı olması ve girdi cümlesine semantik olarak benzer olmasıdır. Bu nedenle, bu ölçütlere ayrı ayrı puan verir ve bunları birleştiririz. Semantik benzerlik için, önceden eğitilmiş modellerden cümle gömme arasındaki kosin benzerliğini kullanırız. Akıcılık için, cümlenin kafa karışıklık puanına dayanan bir puan kullanırız. Kosin benzerliği ve akıcılık puanı ne kadar büyük olursa, ödül o kadar büyüktür.

Çok farklı cümle gömme modelleri ve akıcılık modelleri denedik ve performans makul olsa da, ajanın karşılaştığı ana sorun, semantik benzerliği akıcılıkla yeterince dengeliyor olmamasıydı. Yapılandırmaların çoğu için, ajan akıcılığa öncelik vererek, ayrıntıları çıkarmak ve varlıkların çoğunu bir şeyin “ortasında” veya “bir masa üzerinde” veya “yol kenarında” olarak yerleştirerek performans gösterdi.

Çoklu nesne RL, bu durumda çok zor bir açık araştırma sorusudur.

  1. Ödül Fonksiyonu olarak Karşıt bir Model Kullanma

İnsanların değerlendirme açısından altın standart olarak kabul edildiğinden, iki cümlenin birbirlerinin parafrazı olup olmadığını (insan gibi) tahmin eden ayrı bir modeli, yani ayrımcıyı eğittik. RL modelinin amacı, bu modeli oluşturulan cümlenin girdi cümlesinin parafrazı olduğuna ikna etmektir. Ayrımcı, iki cümlenin birbirlerinin parafrazı olma olasılığını tahmin eden bir puan üretir ve bu, RL modelini eğitmek için kullanılan ödüldür.

Her 5,000 tahminde, ayrımcıya, hangisinin veri kümesinden geldiği ve hangisinin oluşturulduğu söylenir, böylece gelecekteki tahminlerini iyileştirebilir. Süreç, ajanın ayrımcıyı kandırmaya çalıştığı ve ayrımcının oluşturulan parafrazları veri kümesindeki değerlendirme parafrazlarından ayırmaya çalıştığı birkaç tur devam eder.

Birkaç tur eğitimden sonra, ajan, denetimli modelleri ve diğer ödül fonksiyonlarını geride bırakan parafrazlar oluşturur.

Sonuç ve Sınırlamalar

Karşıt yaklaşımlar (oyunlar için kendi kendine oynama dahil) RL algoritmalarını, açık bir ödül fonksiyonu tanımlamadan belirli görevlerde insan düzeyini aşmak için çok vaat edilen bir yaklaşım sağlar.

RL, bu örnekte denetimli öğrenmeyi geride bıraktı, ancak çoğu uygulama için performans kazancına göre ek yük, kod, hesaplama ve karmaşıklık değildir. RL, denetimli öğrenmenin kolayca uygulanamadığı ve bir ödül fonksiyonunun kolayca tanımlanabildiği durumlara bırakılmalıdır (örneğin, Atari oyunları). Yaklaşımlar ve algoritmalar denetimli öğrenmede çok daha olgun ve hata sinyali çok daha güçlüdür, bu da daha hızlı ve daha稳il bir eğitim sağlar.

Diğer bir consideration, diğer sinirsel yaklaşımlar gibi, ajanın daha önce gördüğü girdilerden farklı girdilerde çok dramatik bir şekilde başarısız olabilmesidir, bu da üretim uygulamaları için ek bir katmanlık akıl sağlama kontrolleri gerektirir.

Son yıllarda RL yaklaşımlarına olan ilgi patlaması ve hesaplamalı altyapıda ilerlemeler, endüstriye, özellikle NLP’ye RL uygulamaları için büyük fırsatlar sunacaktır.

Andrew Gibbs-Bravo, Phrasee'de veri bilimcisi olarak çalışmakta ve Phrasee'nin dünya lideri AI-Powered Copywriting teknolojisini geliştirmeye odaklanmaktadır. Ayrıca Londra Peşışřel Öğrenme Topluluğu Meetup'ın ortak organizatörüdür ve tüm RL, NLP ve makine öğrenimi konularına ilgi duymaktadır.