Yapay zeka modelleri ve platformları

SALMONN: Büyük Dil Modelleri için Generic Hearing Abilities’e Doğru

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Duyma, generic ses bilgisi algılama ve anlaşılmasını içeren bir süreçtir ve gerçek dünya ortamlarındaki AI ajanları için çok önemlidir. Bu ses bilgisi, müzik, ses olayları ve konuşma olmak üzere üç temel ses türünü içerir. Son zamanlarda, metin tabanlı Büyük Dil Modeli (LLM) çerçeveleri, Natural Language Processing (NLP) görevlerinin geniş bir yelpazesinde insan düzeyinde performansa ulaşma yeteneği sergilemiştir. Ayrıca, talimat ayarlaması, referans yanıtları ve kullanıcı talimatları çiftlerini kullanarak bir eğitim yöntemi popülerlik kazanmıştır. Bu yaklaşım, büyük dil modellerini daha etkili bir şekilde açık uçlu kullanıcı talimatlarını takip etmeye eğitir. Ancak, güncel araştırmalar giderek büyük dil modellerine çok modelli içerik algılama yeteneği kazandırma konusunda yoğunlaşmaktadır.

Aynı şeyi odaklayarak, bu makalede, SALMONN veya Speech Audio Language Music Open Neural Network hakkında konuşacağız, bu, konuşma ve ses kodlayıcıları ile önceden eğitilmiş metin tabanlı bir büyük dil modelini tek bir ses-metin çok modelli modeline entegre eden bir sanat eseridir. SALMONN modeli, Büyük Dil Modelleri’ne doğrudan generic ses girişlerini anlamak ve işlemek yeteneği kazandırır ve eğitimde kullanılan geniş bir ses ve konuşma görevleri yelpazesinde rekabetçi performans sergiler.

SALMONN çerçevesi, konuşma ve non-speech ses görevleri performansını artırmak için çift kodlayıcı bir yapı kullanır. Bu yapı, BEATs ses kodlayıcısı ve Whisper konuşma modelinden alınan bir konuşma kodlayıcısından oluşur. SALMONN çerçevesi ayrıca, değişken uzunluktaki kodlayıcı çıktısını değişken sayıda ses tokenlerine dönüştürmek için bir Q-Former veya sorgu Transformer kullanır. LoRA veya Low Rank Adaptation yaklaşımı, Vicuna çerçevesinin çıktı alanını girişinin genişletilmiş alanıyla hizalamak için bir çapraz-mod adaptor olarak kullanılır. SALMONN çerçevesi, talimatların eğitim aşamasında kaybedilen çapraz-modem ortaya çıkan yetenekleri kazanmak için birkaç-shot aktivasyon aşamasını uygular.

Ayrıca, çerçevede, bilişsel duymanın değerlendirilmesi için geniş bir ses olayları, müzik benchmarkları ve konuşma benchmarkları kullanılır ve bu benchmarklar üç seviyeye bölünmüştür. İlk seviyede, çerçevede sekiz görev eğitim talimatları dahil edilir, ikinci seviye benchmark konuşma tabanlı NLP görevlerini içerir ve son seviye benchmark görevleri konuşma ve non-speech ses bilgisini anlamak için kullanılır.

Özetle, SALMONN çerçevesi, generic ses girişlerini anlamak ve işlemek için büyük dil modellerine yetenek kazandırma yeteneğine sahip bir çerçevedir. SALMONN modeli, konuşma, ses olayları ve müzik gibi generic ses girişlerini doğrudan anlamak ve işlemek yeteneğine sahiptir.

  1. SALMONN çerçevesi, generic ses girişlerini anlamak ve işlemek için büyük dil modellerine yetenek kazandırma yeteneğine sahip ilk çok modelli büyük dil modelidir.
  2. SALMONN çerçevesi, çapraz-modem ortaya çıkan yetenekleri analiz etmek için LoRA ölçek faktörünü kullanır ve eğitim sırasında çapraz-modem ortaya çıkan yetenekleri etkinleştirmek için ek bir aktivasyon aşaması uygular.

SALMONN: Tek Ses-Metin Çok Modelli Büyük Dil Modellerine Giriş

SALMONN, Speech Audio Language Music Open Neural Network’in kısaltmasıdır ve konuşma, ses olayları ve müzik gibi üç temel ses türünü algılayabilen ve anlayabilen tek bir ses-metin çok modelli büyük dil modeli çerçevesidir. SALMONN modeli, Büyük Dil Modelleri’ne doğrudan generic ses girişlerini anlamak ve işlemek yeteneği kazandırır ve eğitimde kullanılan geniş bir ses ve konuşma görevleri yelpazesinde rekabetçi performans sergiler.

SALMONN çerçevesi, konuşma ve non-speech ses görevleri performansını artırmak için çift kodlayıcı bir yapı kullanır. Bu yapı, BEATs ses kodlayıcısı ve Whisper konuşma modelinden alınan bir konuşma kodlayıcısından oluşur. SALMONN çerçevesi ayrıca, değişken uzunluktaki kodlayıcı çıktısını değişken sayıda ses tokenlerine dönüştürmek için bir Q-Former veya sorgu Transformer kullanır. LoRA veya Low Rank Adaptation yaklaşımı, Vicuna çerçevesinin çıktı alanını girişinin genişletilmiş alanıyla hizalamak için bir çapraz-mod adaptor olarak kullanılır. SALMONN çerçevesi, talimatların eğitim aşamasında kaybedilen çapraz-modem ortaya çıkan yetenekleri kazanmak için birkaç-shot aktivasyon aşamasını uygular.

SALMONN: Mimarisi ve Yöntemi

Bu bölümde, SALMONN çerçevesinin mimarisini, eğitim yöntemini ve deneysel kurulumunu inceleyeceğiz.

Model Mimarisi

SALMONN çerçevesinin temelinde, iki ses kodlayıcısının çıktılarını senkronize eden ve birleştiren bir yapı bulunmaktadır. Ardından, çerçevede, Q-Former veya sorgu Transformer kullanılarak, değişken uzunluktaki kodlayıcı çıktısı değişken sayıda ses tokenlerine dönüştürülür. Q-Former tarafından üretilen çıktı dizisi, metin talimatları ile birleştirilir ve LoRA adaptasyon yaklaşımına girdi olarak verilir.

Ses Kodlayıcıları

SALMONN çerçevesi, iki ses kodlayıcısı kullanır: non-speech BEATs ses kodlayıcısı ve Whisper konuşma modelinden alınan bir konuşma kodlayıcısı. BEATs ses kodlayıcısı, self-supervised öğrenme yaklaşımı kullanarak non-speech yüksek seviye ses semantiklerini çıkarmak için eğitilir. Konuşma kodlayıcısı ise, konuşma tanıma ve konuşma çevirisi görevleri için büyük miktarda zayıf olarak gözetimli veri kullanılarak eğitilir. Kodlayıcıların çıktıları, hem konuşma hem de non-speech bilgisi için uygun olan birleştirilmiş bir çıktı üretir.

Pencere Düzeyinde Q-Former

Q-Former yapısı, LLM çerçevelerinde, görüntü kodlayıcısının çıktısını metin tokenlerine dönüştürmek için kullanılan bir yaklaşım olarak uygulanır. Ancak, ses tokenlerinin değişken uzunlukları nedeniyle, Q-Former yapılarında bazı değişiklikler yapılır. Q-Former, kodlayıcı çıktısını, yığınlanmış Q-Former blokları kullanarak, metin tokenlerine dönüştürür. Her Q-Former bloğu, Transformer decoder bloğuna benzer, ancak self-attention katmanlarında casual maskeleri kaldırır ve ilk bloklarda sabit sayıda trainable sorgu kullanır.

LoRA ve LLM

SALMONN çerçevesi, Vicuna LLM’yi kullanır, bu da talimatları daha doğru bir şekilde takip etmek için fine-tune edilmiş bir LLaMA büyük dil modelidir. LoRA yaklaşımı, parametrik olarak verimli fine-tune için kullanılan bir yöntemdir ve SALMONN çerçevesinde, self-attention katmanlarında ağırlık matrislerini değerlendirmek ve sorguyu uyarlamak için kullanılır.

Eğitim Yöntemi

SALMONN çerçevesi, üç aşamalı çapraz-modelli eğitim yaklaşımını kullanır. Eğitim aşaması, ön-eğitim aşaması ve talimat ayarlaması aşamasından oluşur. Talimat ayarlaması aşaması, çoğu görsel LLM çerçevesinde kullanılan approacha benzerdir. Ek olarak, aktivasyon ayarlaması aşaması, ses açıklama ve konuşma tanıma görevlerinde oluşan over-fitting sorunlarını çözmek için uygulanır.

Ön-Eğitim Aşaması

SALMONN çerçevesi, ön-eğitim aşamasında, büyük miktarda ses açıklama ve konuşma tanıma verisi kullanır. Bu veriler, LoRA ve Q-Former bileşenlerini ön-eğitmek için kullanılır. Bu görevler, ses olaylarının ve konuşmanın temel içeriği hakkında önemli ses bilgisini içerir ve metin ve ses bilgisi arasındaki hizalamayı öğrenmek için karmaşık anlama veya akıl yürütme gerekmez.

Talimat Ayarlaması Aşaması

Talimat ayarlaması aşaması, SALMONN çerçevesinde, ses olayları, müzik görevleri ve konuşma görevleri listesini kullanarak, talimatları daha doğru bir şekilde takip etmek için uygulanır. Görevler, farklı testlere göre önceliklendirilir, örneğin telefon tanıma, konuşma tanıma ve müzik açıklamaları. Metin bilgileri, ses verisi ile birlikte talimatları oluşturmak için kullanılır.

Görev Aşırı Uyumlu

SALMONN çerçevesi, sadece ilk iki eğitim aşamasını uyguladığında, talimat ayarlaması görevlerinde rekabetçi sonuçlar elde eder, ancak çapraz-modelli görevlerde, özellikle çapraz-modelli akıl yürütme yetenekleri gerektiren görevlerde performansı düşük olur. Özellikle, model bazen talimatları ihlal eder ve ilgili veya yanlış yanıtlar üretir, bu da SALMONN çerçevesinde görev aşırı uyumlu olarak adlandırılır. Aktivasyon ayarlaması aşaması, bu aşırı uyumlu sorunlarını çözmek için uygulanır.

Aktivasyon Ayarlaması Aşaması

Görev aşırı uyumlu sorunlarını çözmek için etkili bir approach, içsel koşullu dil modellerini daha uzun ve çeşitli yanıtlarla düzenliyor, örneğin hikaye anlatma veya ses bilgisine dayalı soru-cevap görevleri. Çerçevede, bu görevler için eğitim veri çiftleri oluşturulur ve Q-Former ve LoRA bileşenleri bu approachla fine-tune edilir.

Görev Özellikleri

SALMONN çerçevesinin çapraz-modelli ortaya çıkan yeteneklerini değerlendirmek için, geliştiriciler 15 ses, müzik ve konuşma görevi oluşturmuş ve bunları üç seviyeye bölmüştür.

Seviye 1

İlk seviyede, görevler talimat ayarlaması için kullanılır ve因此 SALMONN çerçevesinin gerçekleştirmesi gereken en kolay görevlerdir.

Seviye 2

İkinci seviye, eğitilmemiş görevleri içerir ve görevlerin karmaşıklık düzeyi, ilk seviye görevlerine göre daha yüksektir. İkinci seviyede, görevler NLP tabanlı görevlerdir, örneğin konuşma anahtar kelime çıkarma, SQQA veya konuşma tabanlı soru-cevap görevleri, konuşma tabanlı slot doldurma görevleri ve iki adet AST görevi, İngilizce-Almanca ve İngilizce-Japonca çevirileri için.

Seviye 3

Üçüncü seviyedeki görevlerin karmaşıklık düzeyi, diğer iki seviyeye göre daha yüksektir ve SAC veya konuşma-ses akıl yürütme görevleri ve ses tabanlı hikaye anlatma görevlerini içerir. SAC görevi, SALMONN çerçevesinin, ses klipindeki bir soruyu anlamasını, ses olayları veya müzik kullanarak destekleyici kanıtları bulmasını ve sonra da soruyu cevaplamak için uygun bir neden üretmesini gerektirir. Ses tabanlı hikaye anlatma görevleri, modelin, genel ses girişlerinden alınan ses bilgisine dayalı anlamlı bir hikaye üretmesini gerektirir.

Sonuçlar

Seviye 1 Görevleri

Aşağıdaki tablo, Seviye 1 görevleri sonuçlarını gösterir ve SALMONN çerçevesinin, aktivasyon ayarlaması ile veya olmadan, Seviye 1 görevlerinde rekabetçi sonuçlar elde ettiği görülmektedir.

Seviye 2 ve 3 Görevleri

SALMONN çerçevesi, Seviye 1 görevlerinde rekabetçi sonuçlar elde edebilir, ancak Seviye 2 ve Seviye 3 görevlerinde, aktivasyon ayarlaması olmadan, görevlerde over-fitting sorunları oluşur. Özellikle, model multimodalli etkileşimlere odaklanan görevlerde, SQQA, SAC ve hikaye anlatma görevlerinde talimatları takip edemez. Ancak, aktivasyon ayarlaması ile sonuçlar önemli ölçüde iyileşir.

LoRA Ölçek Faktörünü Azaltma

LoRA ölçek faktörünü azaltma, LoRA ölçek faktörünün zaman-test indirgeme kullanarak over-fitting sorunlarını minimize etmenin etkisini değerlendirir. Aşağıdaki şekil, LoRA ölçek faktörünü 2.0’a düşürmenin, SALMONN çerçevesinin çapraz-modelli akıl yürütme yeteneğini, ASR ve PR görevlerinde, SQQA görevlerinde, hikaye anlatma görevlerinde ve SAC görevlerinde artırdığını gösterir.

Görev Aşırı Uyumlu Değerlendirmesi

Aktivasyon ayarlaması vurgulamak için, SALMONN çerçevesi, üç eğitim aşamasında karmaşıklığın değişimini analiz eder ve aşağıdaki resim, AAC ve ASR görevleri için karmaşıklığın son değerlerinin, ilk eğitim aşamasından sonra küçük olduğunu gösterir, bu da modelin çapraz-modelli hizalamayı öğrendiğini gösterir.

Aktivasyon Ayarlaması

SALMONN çerçevesi, farklı aktivasyon yöntemlerini araştırır, örneğin, uzun cevaplı metin tabanlı soru-cevap görevleri veya ses tabanlı uzun yazılı hikayeler. Q-Former ve LoRA bileşenleri bu approachlarla fine-tune edilir. Ayrıca, çerçevede, ses ve Q-Former girişlerini ignor ederek, LoRA ve Vicuna bileşenlerini, adaptif metin tabanlı büyük dil modeli olarak fine-tune eder ve sonuçlar aşağıdaki resimde gösterilir.

Son Düşünceler

Bu makalede, SALMONN veya Speech Audio Language Music Open Neural Network hakkında konuşladık, bu, konuşma, ses olayları ve müzik gibi generic ses girişlerini doğrudan anlamak ve işlemek yeteneğine sahip bir çerçevedir. SALMONN modeli, Büyük Dil Modelleri’ne generic ses girişlerini anlamak ve işlemek yeteneği kazandırır ve eğitimde kullanılan geniş bir ses ve konuşma görevleri yelpazesinde rekabetçi performans sergiler.

SALMONN çerçevesi, generic ses girişlerini anlamak ve işlemek için büyük dil modellerine yetenek kazandırma yeteneğine sahip bir çerçevedir. SALMONN modeli, konuşma, ses olayları ve müzik gibi generic ses girişlerini doğrudan anlamak ve işlemek yeteneğine sahiptir. SALMONN çerçevesi, konuşma çevirisi, konuşma tanıma, ses açıklama ve daha fazlası gibi bir dizi ses ve konuşma görevinde rekabetçi performans sergiler ve konuşma çevirisi için anahtar kelime çıkarma ve eğitilmemiş diller gibi eğitilmemiş anlama görevlerine genelleyebilir. SALMONN çerçevesi, büyük dil modellerinin generic duyma yeteneklerini geliştirmeye yönelik bir adımdır.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.