Yapay zeka modelleri ve platformları

Modulate, Ensemble Dinleme Modellerini Tanıtıyor, AI’ın İnsan Sesisini Anlama Şeklini Yeniden Tanımlıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Yapay zeka hızla ilerlemiş olsa da, gerçekten insan sesini anlamak her zaman zor olmuştur. Sadece söylenen kelimeleri değil, arkasındaki duyguyu, ton ve zamanlama tarafından şekillenen niyeti ve dostça sohbeti, aldatmacayı veya zararı ayıran ince sinyalleri anlamak önemlidir. Bugün, Modulate , Ensemble Dinleme Modeli (ELM) adlı yeni bir AI mimarisini tanıttı. Bu mimari, gerçek dünya seslerini anlamak için tasarlandı.

Araştırma duyurusunun yanı sıra, Modulate, Ensemble Dinleme Modelinin ilk üretim dağıtımı olan Velma 2.0i tanıttı. Şirket, Velma 2.0’in konuşma doğruluğunda lider foundation modelleri geçtiğini ve daha düşük maliyetle çalıştığını belirtiyor.

Neden Ses AI için Zordur

Çoğu AI sistemi, sesi analiz ederken benzer bir yaklaşım izler. Ses, metne dönüştürülür ve bu metin daha sonra büyük bir dil modeli tarafından işlenir. Bu süreç, transkript ve özetleme için etkili olsa da, sesin önemli yönlerini ortadan kaldırır.

Ton, duygusal vurgulama, duraklama, alaycılık, çakışan konuşma ve arka plan gürültüsü gibi faktörler önemli bir bağlam taşır. Ses metne dönüştürüldüğünde, bu boyutlar kaybolur ve genellikle niyet veya duyguyu yanlış yorumlamaya neden olur. Bu, müşteri desteği, dolandırıcılık tespiti, online oyun ve AI destekli iletişimlerde özellikle sorunlu hale gelir.

Modulate’e göre, bu sınırlama mimari rather than veri odaklıdır. Büyük dil modelleri metin tahmini için optimize edilmiştir, ancak gerçek zamanlı olarak birden fazla akustik ve davranışsal sinyali entegre etmek için değildir. Ensemble Dinleme Modelleri bu açığı kapatmak için oluşturulmuştur.

Ensemble Dinleme Modeli Nedir?

Ensemble Dinleme Modeli, her şeyi aynı anda yapan tek bir sinir ağı değildir. Bunun yerine, her biri bir ses etkileşiminin farklı bir boyutunu analiz eden birçok uzmanlaşmış modelden oluşan koordine bir sistemdir.

ELM içinde, ayrı modeller duyguyu, stresi, aldatma belirtilerini, konuşmacı kimliğini, zamanlamayı, prosodiği, arka plan gürültüsünü ve sentetik veya taklit edilmiş sesleri inceler. Bu sinyaller, bir konuşmanın ne olduğu hakkında birleşik ve açıklanabilir bir yorum üretmek için zamanla hizalanmış bir orkestrasyon katmanı aracılığıyla senkronize edilir.

Bu açık işbölümü, ELM yaklaşımının merkezinde yer alır. Tek bir büyük modelin anlamı örtük olarak çıkarmak yerine, Ensemble Dinleme Modelleri birden fazla hedefli perspektifi birleştirir, böylece hem doğruluğu hem de şeffaflığı artırır.

Velma 2.0 İçinde

Velma 2.0, Modulate’in önceki ensemble tabanlı sistemlerinin önemli bir evrimidir. Gerçek zamanlı olarak birlikte çalışan 100’den fazla bileşen modeli kullanır ve beş analitik katmana bölünmüştür.

İlk katman, temel ses işleme, konuşmacı sayısını, konuşma zamanlamasını ve duraklamaları belirler. İkincisi, akustik sinyal çıkarma, duygusal durumları, stres seviyelerini, aldatma ipuçlarını, sentetik ses işaretlerini ve çevresel gürültüyü tanımlar.

Üçüncü katman, algılanan niyeti değerlendirir, samimi övgü ile alaycı veya düşmanca yorumlar arasında ayrım yapar. Davranış modelleme, konuşma dinamiklerini zaman içinde izler, frustrasyonu, karışıklığı, betimlenmiş konuşmayı veya sosyal mühendislik girişimlerini işaretler. Son katman, konuşma analizi, bu içgörülerden işletme ile ilgili olayları çıkarır, such as memnuniyetsiz müşteriler, politika ihlalleri, olası dolandırıcılık veya arızalı AI ajanları.

Modulate, Velma 2.0’in konuşma anlamını ve niyetini yaklaşık %30 daha doğru bir şekilde anladığını ve ölçekte %10 ila %100 arasında daha maliyet hiệu olduğunu belirtiyor.

Oyun Moderasyonundan Kurumsal Zekaya

Ensemble Dinleme Modellerinin kökeni, Modulate’in online oyunlarla ilgili erken çalışmalarında yatmaktadır. Call of Duty ve Grand Theft Auto Online gibi popüler oyunlar, hayal edilebilecek en zorlu ses ortamlarını üretir. Konuşmalar hızlı, gürültülü, duygusal olarak yüksektir ve argo ve bağlamsal referanslarla doludur.

Gerçek bir tacizi, gerçek bir hakareti ayırt etmek için sadece transkript yeterli değildir. Modulate, ses moderasyon sistemi ToxMod’u çalıştırırken, dần dần daha karmaşık model kümeleri oluşturdu. Çok sayıda uzmanlaşmış modeli koordine etmek, gerekli doğruluğu elde etmek için zorunlu hale geldi ve sonunda ekibi yeni bir mimari çerçeveye dönüştürmeye yöneltti.

Velma 2.0, bu mimariyi oyun ötesine taşıyor. Bugün, Modulate’in kurumsal platformunu güçlendiriyor ve çeşitli endüstrilerde yüz milyonlarca konuşmayı analiz ediyor, dolandırıcılığı, suistimali, müşteri memnuniyetsizliğini ve anormal AI faaliyetlerini tespit ediyor.

Temel Modellere Bir Meydan Okuma

Bu duyuru, şirketlerin AI stratejilerini yeniden değerlendirdiği bir anda geliyor. Büyük yatırımlara rağmen, AI girişimlerinin büyük bir kısmı üretime ulaşamıyor veya kalıcı değer sağlamıyor. Common engeller arasında hayal power, artan çıkarım maliyetleri, şeffaf olmayan karar verme ve AI içgörülerini operasyonel iş akışlarına entegre etme zorluğu yer alıyor.

Ensemble Dinleme Modelleri bu sorunları doğrudan ele alıyor. Tek bir devasa model yerine birçok küçük, amaç odaklı modeli kullanarak, ELM’ler daha ucuz, daha kolay denetlenebilir ve daha anlaşılabilir hale geliyor. Her çıktı, belirli sinyallere geri izlenebilir, böylece organizasyonlar neden bir sonuca varıldığını anlayabilir.

Bu düzeyde şeffaflık, özellikle karara dayalı siyah kutu kararlarının kabul edilemeyeceği düzenlenmiş veya yüksek riskli ortamlarda önemlidir. Modulate, ELM’leri büyük dil modellerinin yerine değil, kurumsal düzeyde ses zekası için daha uygun bir mimari olarak konumlandırıyor.

Sesten Metne Ötesi

Velma 2.0’ın en ilerici yönlerinden biri, söylenen şeyin nasıl söylendiğini analiz etme yeteneğidir. Bu, sentetik veya taklit edilmiş sesleri tespit etmeyi içerir, bu da ses oluşturma teknolojisi daha erişilebilir hale geldikçe artan bir endişe kaynağı haline geliyor.

Ses klonlama teknolojisi geliştikçe, şirketler dolandırıcılık, kimlik taklit etme ve sosyal mühendislik ile ilgili artan risklerle karşı karşıya kalıyor. Velma 2.0, sentetik ses algılama yeteneğini doğrudan ensemble’a entegre ederek, kimlik doğrulama olarak değil, temel bir sinyal olarak davranıyor.

Sistemlerin davranış modellemesi, proaktif içgörüler sağlar. Bir konuşmacının bir senaryodan okuyup okumadığını, frustrasyonun artıp artmadığını veya bir etkileşimin çatışmaya doğru gitip gitmediğini belirleyebilir. Bu yetenekler, şirketlerin daha erken ve daha etkili bir şekilde müdahale etmesini sağlar.

Kurumsal AI için Yeni Bir Yön

Modulate , Ensemble Dinleme Modelini, geleneksel sinyal işleme boru hatlarından ve büyük temel modellerden farklı bir AI mimari kategorisi olarak tanımlıyor. Altta yatan fikir, karmaşık insan etkileşimlerinin, brute-force ölçeklendirme yerine koordine uzmanlaşma yoluyla daha iyi anlaşıldığıdır.

Şirketler, hesap verebilir, verimli ve gerçek operasyonel ihtiyaçlarla uyumlu AI sistemleri talep ederken, Ensemble Dinleme Modelleri, birçok odaklanmış bileşenden oluşan bir zeka geleceğine işaret ediyor. Velma 2.0 artık üretim ortamlarında canlı olarak çalışırken, Modulate bu mimari değişimin ses moderasyonu ve müşteri desteğinin ötesine geçeceğine bahis yapıyor.

Bir endüstri, her zaman daha büyük siyah kutulara alternatifler ararken, Ensemble Dinleme Modelleri, AI’daki bir sonraki büyük ilerlemenin daha dikkatli dinleme rather than daha agresif hesaplama yoluyla gelebileceğini öne sürüyor.

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.