Anderson’un Açısı
Apple’ın Topluluk Dillerini Çevirme Çözümü

Apple, USC ile birlikte, iOS18 işletim sisteminin kullanıcılarına çeviri konusunda cinsiyet seçeneği sunmak için kullanılan makine öğrenimi yöntemlerini araştıran bir makale yayınladı.

iOS18’de kullanıcılar, yerel Çevirme uygulamasında bir çeviri kelimesi için alternatif cinsiyet önerilerini seçebilir. Kaynak: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios
Çalışmada ele alınan konular, belirli bir ölçüde, cinsiyet tanımları etrafındaki güncel tartışmalara değiniyor, ancak daha eski bir sorunu ele alıyor: dünyanın 229 bilinen dilinden 84’ünün cinsiyet temelli bir cinsiyet sistemini kullandığı gerçeği.

Kırmızı noktalar, cinsiyet temelli bir cinsiyet sistemini kullanan dilleri gösterir. Kaynak: https://wals.info/feature/31A#map
Şaşırtıcı bir şekilde, İngilizce cinsiyet temelli kategorisine girer, çünkü tekil zamirleri eril veya dişil olarak atar.
Öte yandan, tüm Romans dilleri (yarım milyardan fazla İspanyolca konuşucusu dahil) ve diğer popüler diller gibi Rusça, cinsiyet anlaşması gerektirir ve bu da çeviri sistemlerinin dildeki cinsiyet atamasıyla başa çıkmasını gerektirir.
Yeni makale, İspanyolca’da Secretary was angry with the boss cümlesinin tüm olası çevirilerini gözlemleyerek bunu gösterir:

Yeni makaledeki bir örnekte, İngilizce’den İspanyolca’ya çeviri yapılan ‘The secretary was angry with the boss’ cümlesindeki olası cinsiyet atamaları. Kaynak: https://arxiv.org/pdf/2407.20438
Naif çeviri, daha uzun metinler için yeterli değildir, çünkü bunlar başlangıçta cinsiyeti belirleyebilir (‘O’, ‘O’ vb.) ve daha sonra tekrar cinsiyete atıfta bulunmayabilir. Buna rağmen, çeviri, metin boyunca katılımcının atanan cinsiyetini hatırlamalıdır.
Bu, parçalara ayrılmış çevirilere yaklaşan token tabanlı yöntemler için zor olabilir ve içerik boyunca cinsiyet bağlamını kaybetme riski taşır.
Kötüdür, önyargılı cinsiyet atamaları için alternatif çeviriler sunan sistemler, bunları keyfi olarak yapamaz, yani yalnızca cinsiyet isimlerini değiştirmekle kalmaz, aynı zamanda dilin diğer tüm kısımlarının değiştirilen cinsiyet isimlerine uygun olmasını sağlar.
Apple/USC makalesindeki bu örnekte, Secretary eril cinsiyete atanmış olmasına rağmen, tekil geçmiş was feminin olarak bırakılmıştır (estaba):

Kaba kuvvet cinsiyet değişiklikleri, gerekli cinsiyet anlaşmasını göz ardı edebilir. Bu örnekte, ‘enojada’ kelimesi ‘enojado’ olmalıdır, eril ‘El secretario’ ile anlaşmak için.
Cinsiyet Konuları
Yeni makalede, Apple ve USC araştırmacıları, yeni bir makale yayınladı, Cinsiyet Alternatiflerini Makine Çevirisi Oluşturma adlı bir makalede, cinsiyet belirsiz varlıkları varlık düzeyinde alternatiflere dönüştürmek için yarı denetimli bir yöntem önerdiler.
Sistem, Apple Translate uygulamasında iOS18’de çeviri için kullanılan, büyük dil modellerinin (LLM’ler) ve önceden eğitilmiş açık kaynaklı makine çevirisi modellerinin fine-tuning yoluyla dil şeması oluşturur.
Sonuçlar, bu sistemlerden alınan çevirilerle eğitildi ve ardından cinsiyet yapıları içeren bir mimariye aktarıldı – çeşitli cinsiyetli isimlerin aynı varlığı temsil ettiği cümle grupları.
Makale şöyle diyor:
‘Eğitim verisinde bulunan cinsiyet önyargıları, doğal dil işleme (NLP) sistemlerine bulaşabilir ve bu önyargıların yayılması ve potansiyel olarak güçlendirilmesi ile sonuçlanabilir. Bu önyargılar genellikle hataların da temel nedenidir.
‘Bir makine çevirisi (MT) sistemi, örneğin, “doktor”u İspanyolca médico (eril) yerine médica (dişil) olarak çevirebilir, girdide “The doctor asked the nurse to help her in the procedure” yazıyorsa.
‘Doğru cinsiyeti belirleyemeyen MT sistemleri, bağlam aracılığıyla cinsiyeti belirlemek zorundadır. Geçerli tüm cinsiyet seçeneklerini kapsayan birden fazla çeviri alternatifi sunmak, makul bir yaklaşımdır.’
Yöntem, temelde, bir çeviriyi tek bir token yerine kullanıcı tarafından kontrol edilen bir diziye dönüştürür.
(Makalede bahsedilmediği üzere, bu, Apple Translate veya benzeri çeviri hizmetleri sunan portallarda, kullanıcı seçimlerinin daha sonraki model iterasyonlarına geri beslenmesine olanak tanır.)
Model, GATE ve MT-GenEval test kümeleri üzerinde değerlendirildi. GATE, en fazla 3 cinsiyet belirsiz varlığa sahip kaynak cümleleri içerirken, MT-GenEval, kullanıcıya alternatif cinsiyet seçenekleri sunulmaması gereken malzemeleri içerir.
Her iki test kümesi de projenin amaçlarına uygun olarak yeniden etiketlenmiştir.
Sistemi eğitmek için, araştırmacılar, geleneksel kurallara dayalı yöntemler yerine, bir veri odaklı yaklaşımı benimseyerek, G-Tag veri kümesinde önceden eğitilmiş bir BERT dili modelini fine-tune ettiler.
Çift Bakış
Belirsiz cinsiyet varlıklarını tespit edilen durumlarda, Apple ve USC, iki yöntem keşfetti: önceden eğitilmiş dil modellerinin fine-tuning’u ve LLM’lerin kullanımı.
İlk yöntemle ilgili olarak makale şöyle diyor:
‘G-Trans veri kümesinden çıkarılan bir bitext üzerinde önceden eğitilmiş bir MT modeli M fine-tune ederiz. Bu bi-textin kaynak cümleleri, <M>/<F> etiketleriyle belirsiz varlıkları içerir ve hedef çeviride, cinsiyet etiketlerine göre doğru cinsiyet eklemleri vardır.’

G-Trans veri kümesinden bi-text çıkarma şemasının bir illüstrasyonu.
Resimde, alt orta sütunda fine-tune edilmiş metni ve sağ sütunda istenen çıktıyı görüyoruz, alttaki şemada ise temel mantık açıklanmaktadır.
Bu yaklaşım için, araştırmacılar, daha önce 2020 çalışmasında kullanılan bir lattice rescoring yöntemini kullandılar. Sadece hedef alan (cinsiyet) ele alındığını sağlamak için, bir kısıtlanmış ışın arama filtresi kullanıldı.
LLM yaklaşımı için, araştırmacılar, cinsiyet atamaları sağlamak için bir LLM’i düzenleyici olarak kullandıkları bir strateji geliştirdiler.

LLM, bağlam içi bir örnek kullanarak cinsiyet ataması yapar.
Her iki yaklaşımın sonuçları birleştirildi ve model, daha sonra kaynak tokenleri hizalı (şemada ‘1’ ile gösterilir) veya hizasız (şemada ‘2’ ile gösterilir) olarak sınıflandırılmak üzere fine-tune edildi.

Her iki yaklaşımın sonuçlarının birleştirilmesi için bir şema.
Veri ve Testler
Proje için kullanılan belirsiz varlık dedektörü, Facebook AI’ın xlm-roberta-large modelini, tüm beş dil çifti boyunca transformer kullanarak fine-tune ederek geliştirildi.
İlk olarak, M2M 1.2B modeli, Fairseq üzerinde, G-Trans veri kümesinden bi-text verileriyle birlikte eğitildi, Wiktionary’den cinsiyet eklemleri sağlandı.
LLM yöntemi için, araştırmacılar GPT-3.5-turbo kullandılar. Cinsiyet yapılarının hizalanması için, G-Trans’tan cinsiyet hizalamaları çıkarılarak xlm-roberta-large yeniden kullanıldı.
Alternatiflerin değerlendirilmesi için metrikler, yapı ( duyarluluk ve geri çağırma ile birlikte) ve hizalama doğruluğu.
İlk ikisi kendini açıklar, hizalama doğruluğu, bilinen doğru kaynak kimliğine uygun olan çıktı cinsiyet yapılarının yüzdesini ölçer ve δ-BLEU yöntemini kullanır, MT-GenEval metodolojisine uygun olarak.
Aşağıda, veri artırma pipeline’nin sonuçları verilmiştir:

Veri artırma testlerinin sonuçları. Yukarı oklar ‘daha yüksek – daha iyi’, aşağı oklar ‘daha düşük – daha kötü’ anlamına gelir.
Araştırmacılar şöyle diyor:
‘Hem M2M hem de GPT, İngilizce-Rusça dışında, nispeten benzer performans gösterir, ancak GPT, İngilizce-Rusça’da çok daha düşük alternatif geri çağırma (58.7’ye karşı 89.3) elde eder. Oluşturulan cinsiyet yapılarının kalitesi, İngilizce-Almanca ve İngilizce-Portekizce için GPT’de, İngilizce-İspanyolca ve İngilizce-Rusça için M2M’de daha iyidir, yapı metriklerinden de anlaşılacağı gibi.’
‘İngilizce-İtalyanca için G-Trans verisi bulunmadığından, M2M modelinin ve İngilizce-İtalyanca’daki hizalama doğruluğunun sonuçları, M2M ve XLM modellerinin sıfır-shot genellemesinden kaynaklanmaktadır.’
Araştırmacılar ayrıca, veri artırma sisteminin performansını, M2M aracılığıyla, GATE’nin cümle düzeyinde cinsiyet yeniden yazma yöntemiyle karşılaştırdı.

Apple/USC veri artırma pipeline’nin GATE cümle düzeyinde yöntemiyle karşılaştırılması.
Makale şöyle diyor:
‘GATE’de önerilen F.5 metriğinde tüm 3 dil çiftinde GATE’yi geçtiğini görüyoruz. Doğrulukta nispeten küçük bir bozulma pahasına geri çağırma açısından önemli iyileştirmeler elde ediyoruz.’
Son olarak, araştırmacılar, çeşitli “vanilya” çok dilli modelleri “vanilya bi-text”e eğittiler. Katkıda bulunan veri kümeleri, WikiMatrix, WikiTitles, Multi-UN, NewsCommentary ve Tilde idi.
İki ek vanilya modeli eğitildi, biri G-Trans veri kümesini <gender> önek etiketiyle birleştirdi ve bu, denetimli temel olarak kullanıldı; ve üçüncü, cinsiyet yapısı ve hizalamaları (küçük yerel modelde, çünkü GPT’nin API tabanlı hizmetlerini kullanmak bu amaç için çok pahalı olurdu) birleştirdi.
Modeller, 2022 FloRes veri kümesiyle test edildi.

Uçtan uca vanilya makine çevirisi modellerinin test edilmesi (P = doğruluk, R = geri çağırma).
Makale bu sonuçları özetliyor:
‘Vanilya model, alternatifler üretemez ve eril formları üretmede büyük bir önyargı gösterir (δ-BLEU 5.3 ila 12.5 puan arasında).
‘Bu önyargı, denetimli temel tarafından azaltılır. Artırılmış veri üzerinde eğitilen model, alternatif metriklerinde, hizalama doğruluğunda ve δ-BLEU’de en iyi performansı elde eder ve ayrıca G-Trans verisi bulunmayan İngilizce-İtalyanca için rekabetçi bir sistem sağlar.’
Araştırmacılar, makine çevirisi alanının en zorlu alanlarından biri olan cinsiyet atamasını mantıksal bir şekilde çözmekte NLP’nin mücadelesinin daha geniş bağlamında modelin başarısının değerlendirilmesi gerektiğini belirtiyorlar ve bu sorunun hala açık olduğunu not ediyorlar.
Araştırmacılar, elde edilen sonuçların, cinsiyetle ilgili belirsizlikleri ve/veya cinsiyetle ilgili çevirilerdeki cinsiyet atanmasını ortadan kaldırmaya yönelik hedefi tam olarak gerçekleştiremediğini düşünse de, bu çalışmanın gelecekteki araştırmalar için güçlü bir araç olacağını düşünüyorlar.
* Araştırmacıların satır içi alıntılarını hiperlinklere dönüştürme işleminin benim tarafımdan yapılması.
İlk olarak 8 Ekim 2024 Salı günü yayımlandı.












