Yapay zeka modelleri ve platformları
HierSpeech++ : Hiyerarşik Variationel İnceleme için Zero-Shot Konuşma Sentezi
Son gelişmeler ve büyük dil modellerinin yeteneklerinde yaşanan ilerlemeler, ses üretimi ve konuşma sentezi görevleri özellikle zero-shot ayarında önemli bir rol oynamıştır. Geleneksel konuşma sentezi çerçeveleri, nöral ses kodlayıcıları gibi ek özellikler entegre edilmesiyle önemli ilerlemeler kaydetmiştir. Ancak bu konuşma ve ses sentezi çerçeveleri tatmin edici sonuçlar üretmesine rağmen, hala geliştirme alanı bulunmaktadır. Mevcut LLM tabanlı ses çerçevelerinin üç temel sınırlaması bulunmaktadır:
- Otomatik olarak ses çıktısı üretme eğilimindedirler, bu da dayanıklılık eksikliğine ve yavaş inference hızlarına neden olur ve telaffuz hataları, atlamalar veya tekrarlamalara yol açar.
- Ayrık konuşma birimleri veya önceden eğitilmiş nöral ses kodlayıcılarına fazla bağımlıdırlar.
- Genellikle büyük miktarda eğitim verisi gerektirirler.
Yukarıda belirtilen sorunları ele almak ve LLM tabanlı ses ve konuşma sentezi modellerinin yeteneklerini geliştirmek için, geliştiriciler HierSpeech++ adlı bir konuşma sentezleyici geliştirdiler. HierSpeech++ çerçevesi, hiyerarşik konuşma sentezi çerçevelerinin öğrenimlerini temel alır ve sentetik ses çıktısının doğallığını, konuşmacı benzerliğini ve ifade gücünü artırır.
Bu makalede, HierSpeech++ çerçevesini detaylı olarak inceleyecek, modelin mimarisini, çalışma şeklini ve diğer metin ve ses üretimi modelleriyle karşılaştırıldığında elde edilen sonuçları göreceğiz.
HierSpeech++ , hızlı, dayanıklı ve verimli bir zero-shot konuşma sentezi çerçevesidir ve hiyerarşik bir konuşma sentezi pipeline’ı kullanır. Bu uçtan uca konuşma sentezi çerçevesini benimsemekle, HierSpeech++ modeli yüksek kaliteli dalga formu üretiminin potansiyelini maksimize eder ve anlamsal ve akustik temsil arasındaki boşluğu hiyerarşik olarak köprüler.
VITS modeli tarafından ilk kez tanıtılan uçtan uca konuşma sentezi çerçevesi, VAE veya Variationel Auto-Encoder’i adversite eğitim ve normalleştirme akışıyla güçlendirir. Ayrıca, VAE tabanlı çerçevelerle uçtan uca eğitim pipeline’ı, diğer konuşma sentezi çerçevelerince üretilenlere göre daha yüksek kaliteli dalga formu sesi üretme yeteneğine sahiptir.
Ancak, bu çerçevelerin audio yeniden yapılandırma kalitesini daha da geliştirmek mümkündür. HierSpeech çerçevesinde kullanılan hiyerarşik koşullu Variationel Auto-Encoder, bu amaç için kullanılabilir.
HierSpeech++ modeli, önceki modellerin karşılaştığı sorunları ele almak için bir dizi bileşen kullanır. Bunlar arasında hiyerarşik bir konuşma sentezleyici, bir konuşma süper çözünürlüğü ve bir metin-vektör bileşeni bulunur.
Modelin mimarisi, farklı bileşenlerin nasıl bir araya geldiğini ve nasıl çalıştığını gösterir.
HierSpeech++ modelinin performansı, çeşitli objektif ve subjektif metriklere göre değerlendirilir. Sonuçlar, modelin zero-shot konuşma sentezi görevlerinde başarılı olduğunu gösterir.
Sonuç olarak, HierSpeech++ modeli zero-shot konuşma sentezi için güçlü ve etkili bir çerçeve sunar. Modelin yetenekleri, konuşma sentezi alanında önemli bir ilerleme sağlar ve gelecekteki nghiênmelere yol açabilir.
HierSpeech++ modeli, aşağıdaki katkıları hedefler:
- Hiyerarşik bir konuşma sentezi çerçevesini kullanarak ses stillerini ve prosodileri kontrol etmek ve aktarmak.
- Veri ölçeklenebilirliğini sağlamak ve yüksek çözünürlüklü konuşma sentezini 16 kHz’den 48 kHz’e dalga formu sesini üreterek gerçekleştirmek.
- Zero-shot ses dönüştürme ve metin-konuşma görevlerinde insan düzeyinde yetenek elde etmek.
HierSpeech++ : Model Bileşenleri ve Mimarisi
HierSpeech++ modeli, zero-shot konuşma sentezi için tasarlanmış bir modeldir ve insan düzeyinde doğruluk elde etmeyi hedefler.
Model, farklı bileşenlerden oluşur. Bunlar arasında hiyerarşik bir konuşma sentezleyici, bir konuşma süper çözünürlüğü ve bir metin-vektör bileşeni bulunur.
Konuşma Temsilleri
HierSpeech++ modeli, konuşma sentezi için 16 kHz’de örnekleme yapar. Ayrıca, ses sinyalini yeniden yapılandırmak için en az iki katına çıkarılması gereken en yüksek ses frekansını kullanır.
Model, algısal kaliteyi artırmak için konuşma süper çözünürlüğü veya SpeechSR bileşenini kullanır ve 16 kHz’den 48 kHz’e ses örneklemesini çıkarır.
Hiyerarşik Konuşma Sentezleyici
Hiyerarşik Konuşma Sentezleyici, HierSpeech++ modelinin temel bileşenidir. Model, etiketsiz konuşma verisi kullanarak eğitilebilir ve yalnızca konuşma verisine dayanır.
Model, daha zengin ve kapsamlı akustik temsilleri yakalamak için bir çift-audio akustik kodlayıcı kullanır.
Metin-Vektör
Metin-Vektör bileşeni, metin-giriş konuşma sentezi için kullanılır. Model, metin girişinden bir temel frekans ve anlamsal temsil üretir.
Konuşma Süper Çözünürlüğü veya SpeechSR
Konuşma Süper Çözünürlüğü, düşük çözünürlüklü konuşma dalga formunu yüksek çözünürlüklü konuşma dalga formuna çıkarır.
Mimarisi
Modelin mimarisi, farklı bileşenlerin nasıl bir araya geldiğini ve nasıl çalıştığını gösterir.
Deneysel Sonuçlar
HierSpeech++ modeli, LibriTTS veri setini kullanarak eğitilir.
Modelin performansı, çeşitli objektif ve subjektif metriklere göre değerlendirilir.
Yeniden Yapılandırma, Yeniden Sentezleme Görevleri ve Ses Dönüştürme
Modelin performansı, yeniden yapılandırma ve yeniden sentezleme görevlerinde değerlendirilir.
Son Düşünceler
HierSpeech++ modeli, zero-shot konuşma sentezi için güçlü ve etkili bir çerçeve sunar. Modelin yetenekleri, konuşma sentezi alanında önemli bir ilerleme sağlar ve gelecekteki nghiênmelere yol açabilir.












