Fonlama

Modulate, Sesli AI için Zeka Katmanını Oluşturmak amacıyla $25M topladı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Modulate yeni fon olarak $25 milyon topladı; Boston merkezli şirket, yapay zekadaki artan bir sorunu değerlendirmeyi hedefliyor: makinelerin yalnızca insanların ne söylediğini değil, nasıl söylediğini de anlamasını öğretmek.

Future Ventures turu yönetti, Hyperplane ve Lakestar katıldı. Bu finansman, Modulate’ın toplam fonunu $60 milyon seviyesine çıkardı ve AI araştırması, mühendislik ekipleri, geliştirici araçları, ortaklıklar ve dağıtım seçeneklerini genişletmek için kullanılacak.

Yatırım, sesin giderek AI ajanları, müşteri hizmetleri platformları, oyun ortamları ve güvenlik sistemleri için bir arayüz haline gelmesiyle ortaya çıkıyor. Speech-to-text teknolojisi büyük ölçüde gelişmiş olsa da, Modulate, yalnızca transkriptlerin insan konuşmasında bulunan bilgilerin büyük bir kısmını dışarıda bıraktığını düşünüyor.

Teknolojisi, sesin altında yatan sinyalleri, örneğin duygu, ton, niyet, duraklamalar, sentetik konuşma ve konuşma davranışı gibi, analiz ediyor.

Speech-to-Text’in Ötesine Geçmek

Günümüz sesli AI yığını, nispeten basit bir mimari izler: konuşmayı metne dönüştürmek ve ardından elde edilen transkripti büyük bir dil modeline (LLM) göndermek.

Bu, kelimelerin kendisinin ilgili bilgilerin çoğunu içerdiği durumlarda iyi çalışır. Anlamın alay, hayal kırıklığı, tereddüt, stres, kesintiler veya ton değişikliklerine bağlı olduğu durumlarda ise sınırlayıcı olur.

Modulate, bu sinyallerin bir transkriptten sonra yeniden oluşturulmak yerine doğrudan sesten analiz edilmesi gerektiği fikri etrafında amiral gemisi Velma platformunu inşa etti.

Şirket, Velma’yı aynı anda transkript üretebilen ve konuşmacıları, duyguları, konuşma konularını, duygu durumunu ve 150’den fazla davranışı tanımlayabilen ses‑yerel bir konuşma zekâ sistemi olarak tanımlıyor. Geliştiriciler ayrıca doğal dil açıklamalarıyla özel davranışlar tanımlayabilir.

Bu, teknolojiyi bir çağrı bozulmadan önce hayal kırıklığına uğramış bir müşteriyi tespit etmekten, bir finansal işlem sırasında şüpheli davranışı algılamaya veya bir AI ses ajanının beklenmedik şekilde davrandığını belirlemeye kadar çeşitli uygulamalara açıyor.

Haziran ayında, Modulate, Velma’yı doğrudan bir API aracılığıyla geliştiricilere açtı ve önceki kurumsal dağıtımlarının ötesinde erişimi genişletti.

Modulate, Ses AI’ye Ensemble Yaklaşımı Benimsiyor

Velma’nın altındaki mimari, Modulate’ın Ensemble Listening Model (ELM) olarak adlandırdığı yapıdır.

Her bir görevi tek bir dev modelle yerine getirmek yerine, ELM 100’den fazla uzmanlaşmış modeli koordine eder; bireysel bileşenler bir ses akışının farklı özelliklerini analiz eder.

Bu modeller, konuşmacı değişimleri ve duraklamalar gibi temel özelliklerin yanı sıra duygu, algılanan niyet, sentetik ses işaretçileri, kafa karışıklığı veya davranış kalıpları gibi üst‑seviye sinyalleri inceleyebilir. Bir orkestrasyon katmanı daha sonra bu gözlemleri konuşmanın daha geniş bir yorumuna birleştirir.

Bu, ses üzerine giderek daha büyük multimodal temel modeller uygulama stratejisinden belirgin şekilde farklı bir felsefedir.

Modulate, uzmanlaşmanın mimarisinin daha şeffaf çıktılar sunmasını sağlarken gereken hesaplama miktarını azalttığını savunuyor. Dolandırıcılık tespiti ve uyumluluk gibi kurumsal uygulamalarda, bir sistemin neden bir uyarı verdiğini anlamak, uyarının kendisi kadar önemli olabilir.

Şirkete göre, bu yaklaşım bazı ses‑analizi iş yüklerinde tek bir büyük model kullanmaya göre 1.000 kat daha hesaplama açısından verimli olabilir.

Sesli AI Yeni Bir İzleme Sorunu Yaratıyor

Finansmanın zamanlaması, kurumsal AI’da gerçekleşen daha geniş bir değişimi de yansıtıyor.

AI sistemleri, müşterilerle tam sesli konuşmalar yürütme yeteneğine giderek daha fazla sahip oluyor. Bu, şirketlerin artık yalnızca insan çalışanları değil, binlerce hatta potansiyel olarak milyonlarca konuşma boyunca çalışan otonom ajanları da içeren etkileşimleri izlemeleri gerektiği anlamına geliyor.

Bir ses ajanı teknik olarak bir senaryoyu izleyebilir ancak müşterileri sürekli kesebilir, hayal kırıklığını tanıyamayabilir, niyeti yanlış anlayabilir veya duygusal durumlara kötü yanıt verebilir.

Modulate, bu ajanların yanına oturan bağımsız bir dinleme katmanı olma fırsatını görüyor.

Ses‑ajanı teknolojisi, kesintiler, duraklamalar, duygular, aksanlar ve yalnızca metinden yakalanması zor diğer özellikler gibi sinyalleri tanımlamak üzere tasarlanmıştır; bu sayede geliştiriciler, konuşmalar hâlâ sürerken bir ajanın davranışını ayarlayabilir.

Aynı altyapı, kuruluşların gerçek zamanlı olarak dolandırıcılık, uyumluluk riskleri, taciz veya diğer potansiyel olarak önemli olayları tespit etmesi gereken insan konuşmalarına uygulanabilir.

Oyun Moderasyonundan Daha Geniş Ses Zekâsına

Modulate’ın mevcut hedefleri, çevrimiçi oyunlara yönelik önceki odak noktasından önemli bir genişlemeyi temsil ediyor.

En tanınmış ürünlerinden biri olan ToxMod, oyun ve sosyal platformlardaki canlı ses iletişimlerini analiz etmek ve taciz, tehdit, istismar ve diğer zararlı davranışları tespit etmek amacıyla geliştirildi.

Bu, işin hâlâ önemli bir parçası olarak kalıyor. Modulate, ToxMod’un mevcut ses altyapısıyla doğrudan entegre olabildiğini ve potansiyel olarak sorunlu etkileşimleri denetleme sistemlerine ya da insan gözden geçiricilere yönlendirebildiğini belirtiyor.

Şirket, Activision, Riot Games, Rockstar Games ve Rec Room gibi büyük oyun şirketleriyle çalıştı.

Ancak çok oyunculu bir oyunda toksisiteyi anlamak için gereken temel teknoloji, bağlamın önemli olduğu diğer ortamlara da uyarlanabilir.

Modulate artık teknolojisini sahtecilik önleme, iletişim merkezleri, AI ajan denetimi, deepfake tespiti, müşteri deneyimi ve güven ve emniyet alanlarında konumlandırıyor.

Geliştirici platformu şu anda transkripsiyon, deepfake tespiti, ses redaksiyonu, konuşma zekâsı ve diğer ses analiz yeteneklerini kapsayan çeşitli model aileleri sunuyor.

Deepfake’ler, sesin doğrudan anlaşılmasına bir neden daha ekliyor

Synthetic speech bu fırsatın bir başka önemli parçası haline geliyor.

Giderek daha ikna edici ses klonlaması mümkün hale geldikçe, finansal işlemler veya hassas bilgilerle çalışan kuruluşların yalnızca arayanın ne söylediğini değil, sesin kendisinin de gerçek olup olmadığını belirlemeleri gerekiyor.

Modulate bu nedenle deepfake tespitine yönelerek, sentetik ses analizini ses modelleri aracılığıyla elde edilen daha geniş bağlamsal bilgilerle birleştiriyor.

Şirket, teknolojisinin şu anda ayda 10 milyondan fazla saat ses analiz ettiğini ve toplamda 600 milyondan fazla saat ses işlediğini belirtiyor.

Yapay zeka tarafından üretilen müzik tespiti gibi alanlara genişlemesi, temel topluluk mimarisinin ne kadar geniş bir yelpazede uygulanabileceğini de gösteriyor. Örneğin Modulate’ın müzik tespit sistemi, müzik varlığını, yapay zeka tarafından üretilen vokalleri ve yapay zeka tarafından üretilen enstrümantasyonu ayrı ayrı değerlendirir ve ardından sinyalleri yorumlanabilir bir sonuçta birleştirir.

Ses AI için Bir Sonraki Zorluk Konuşmak Değil, Anlamaktır

$25 milyonluk yatırım, Modulate‘a araştırma, mühendislik, geliştirici araçları ve ortaklıklarını genişletmek için ek kaynaklar sağlıyor. Daha geniş bir perspektifte, bu yatırım ses AI için artan bir zorluğu yansıtıyor: doğal konuşmak, bir sohbetin sadece yarısı.

Ses ajanları müşteri hizmetleri, sağlık, finansal hizmetler ve diğer alanlara girdikçe, sistemlerin transkriptlerin sıkça kaçırdığı sinyalleri, örneğin hayal kırıklığı, tereddüt, vurgu, ton ve olası sentetik konuşmayı anlaması gerekecek.

Bu, ses etkileşimlerinin etrafında yeni bir zekâ katmanı oluşturabilir; sistemlerin sahteciliği tespit etmesine, müşterilerin memnuniyetsizliğini fark etmesine veya bir AI ajanının bir konuşmayı yanlış anladığını ya da hatalı yönettiğini belirlemesine yardımcı olur.

Ancak teknoloji aynı zamanda gizlilik, doğruluk ve önyargı konularında sorular ortaya çıkarıyor. Konuşmadan duygu ya da niyet çıkarmak, kelimeleri transkribe etmekten daha öznel bir süreçtir; özellikle farklı aksan, dil ve kültürler arasında.

AI giderek bir insan gibi konuşma yeteneği kazandıkça, bir sonraki sınır makinelerin ne kadar iyi dinleyebildiğini ve bu yeteneklerin ne kadar sorumlu bir şekilde kullanıldığını belirlemek olabilir.

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.