Yapay zeka modelleri ve platformları
AudioShake, çakışan konuşmaları AI eğitim verisine dönüştürmek için The Refinery’i piyasaya sürdü

İnsanlar kesintiye uğrar. Başkasının son cümlesi üzerine gülerler, bir konuşmacı bitirmeden hızlı bir onay verirler ve müzik ya da trafik arka planı doldururken konuşmaya devam ederler. Bir ses AI geliştiricisi için bu günlük karmaşa zor bir veri sorunu yaratır: bir kayıt, bir modelin öğrenmesi gereken tam konuşma davranışını içerebilir, ancak tek bir karışık ses akışı olarak ortaya çıkar.
AudioShake, bu boşluğu The Refinery ile hedefliyor; mevcut kayıtları AI eğitimi için yapılandırılmış, konuşmacı ayrılmış verilere dönüştüren yeni bir sistem. Geliştiricilerden yeni konuşmalar sahnelemelerini ya da sentetik örnekler üretmelerini istemek yerine, şirket, kuruluşların zaten kullanım hakkına sahip olduğu kayıtlarından bireysel sesleri ve diğer ses bileşenlerini çıkarmanın bir yolunu sunuyor.
Bu duyuru, ses ayrımını ses AI geliştirme sürecinin merkezine daha yakın bir konuma getiriyor. İlginç soru, veri setlerinin gerçek konuşmanın zamanlamasını ve karmaşıklığını korurken etiketleme, inceleme ve kullanım açısından daha kolay hale gelip gelemeyeceği.
Tamamlanmış Bir Kaydı Ayrı Konuşmacı İzlerine Dönüştürmek
AudioShake’in duyurusuna göre, The Refinery, konuşmaları bireysel konuşmacı izlerine ayırırken diyalogu müzik ve arka plan sesinden ayırabiliyor. Orijinal kayıt oturumuna ya da ayrı ayrı yakalanmış stem’lere ihtiyaç duymadan, doğrudan kaydedilmiş ses üzerinden çalışıyor. İki kişi aynı anda konuştuğunda, amaç seslerini ayrı ayrı geri kazanmak ve çakışan etkileşimi korumaktır.
Bu, kaydı yalnızca tek bir baskın ses kalacak şekilde temizlemekten farklıdır. Bir kesinti, istenmeyen gürültü yerine önemli bir eğitim bilgisi olabilir. Kısa bir onay, birinin dinleyip dinlemediğini, onaylayıp onaylamadığını ya da söz almayı planlayıp planlamadığını iletebilir. Bir etkileşimi tek bir akışa düzleştirmek, bu davranışları doğru konuşmacıyla ilişkilendirmeyi zorlaştırabilir.
Çıktıyı düşünmenin yararlı bir yolu, hizalanmış izler kümesi olarak görmek olabilir. Biri belirli bir konuşmacının sesini, diğeri ikinci bir konuşmacının sesini taşır ve ortak zamanlamaları ne zaman çakıştıklarını gösterir. Konuşmanın kendisinin yeniden yazılmasını gerektirmeden kaydı incelemek daha kolay hale gelir.
AudioShake, sistemin konuşma üretmediğini ya da yeniden oluşturmadığını belirtiyor: ayrılmış sesler ve ilgili frekanslar orijinal kayıttan geliyor. Bu ayrım, gerçek konuşma davranışına ait örnekler arayan geliştiriciler için önemlidir. İşlem, kaydedilen şeyi ortaya çıkarmayı amaçlar; yeni bir performans yaratmayı değil.
Neden Konuşmacı Ayrımı Diyarizasyondan Öteye Geçer
AudioShake’in Multi-Speaker Separation ürün sayfası, konuşmacı ayrımı ve diyazirasyonun bir kombinasyonunu tanımlıyor. Diyazirasyon, farklı konuşmacıların ne zaman aktif olduğunu belirler; ayrım ise bireysel ses sinyalleri üretir. Bir zaman aralığını iki konuşmacı içeriyor olarak etiketlemek, tek başına bir geliştiriciye iki bağımsız olarak kullanılabilir ses izi sağlamaz.
Ürün ayrıca sesin doğru konuşmacıya atanmasındaki güveni, ayrım kalitesindeki güvenden ayırıyor. Bunlar farklı sorunları ele alır: bir ses doğru şekilde tahsis edilmiş olabilir ancak yine de başka bir kişiden gelen sesleri içerebilir. AudioShake, temel sistemi dil modeline bağımlı olmaktan ziyade akustik olarak tanımlıyor ve farklı örnekleme oranları ve yakalama koşullarına sahip kayıtları destekliyor.
Bir eğitim hattı için bu işlevleri ayırmak, incelemeyi daha hassas hale getirebilir. Bir ekip, konuşmacı kimliğini, belirli bir izin netliğini ya da sonradan üretilen transkriptin doğruluğunu incelemek zorunda kalabilir. Üçünü tek bir başarı ya da başarısızlık olarak ele almak, hatanın veri setine nereden girdiğini gizler.
Kalite Puanları Veri Boru Hatlarının Bir Parçasıdır
The Refinery, çıktıları kalite ve güven açısından puanlayarak, kuruluşların büyük koleksiyonları kullanılabilir, düzeltilebilir veya uygun olmayan materyallere ayırmasına olanak tanır. Bu önemli bir operasyonel özelliktir. Büyük bir ses arşivi ölçeğinde, her dakikayı manuel olarak dinlemek, ayrım otomatik olsa bile bir darboğaz haline gelir.
Puanlar, insan dikkatini şüpheli bölümlere yönlendirmeye yardımcı olabilir. Örneğin, bir veri seti ekibi, sessiz bir konuşmacının ayırt edilmesinin zor olduğu kalabalık bir konuşmayı, aynı yoğunlukta tek kişilik basit bir kaydı incelemek yerine önceliklendirebilir.
Yönetilmesi gereken bir denge de vardır. Yalnızca en kolay ve en net klipleri seçmek, projenin yakalamayı amaçladığı zor durumları kaçıran bir veri seti oluşturabilir. Değerlendirmemize göre, bu tür bir boru hattı kullanan ekipler, çıktı kalitesini ve filtrelemeden sonra kalan konuşma çeşitliliğini birlikte değerlendirmelidir. Zorlu örnekleri dikkatli bir inceleme ile korumak, tek bir toplu güven puanını maksimize etmekten daha faydalı olabilir.
Bu nedenle eğitim hazırlığı, ayrı dosyalar üretmekten daha fazlasını içerir. Geliştiriciler hâlâ izlerin, transkriptlerin, zamanlamanın, konuşmacı etiketlerinin ve kalite meta verilerinin kendi öğrenme hedeflerine nasıl uyduğunu belirlemelidir.
AudioShake’in Kıyaslamasının Gösterdikleri—Ve Sınırlamaları
Kendi Multi-Speaker 2.0 teknik değerlendirmesinde, AudioShake, LibriCSS üzerinde %9.17’lik birleştirilmiş minimum-permutasyon kelime hata oranı rapor ediyor, test edilen MERL TF-Locoformer kontrol noktası için %37.75 ile karşılaştırıldığında. Her ikisi de aynı Whisper large-v3 transkripsiyon hattı üzerinden değerlendirildi. Daha düşük hata oranları, bu değerlendirmede daha az transkripsiyon hatası olduğunu gösterir.
Nitelik önemlidir: temel kontrol noktası eğitim alanının dışında test edilmiştir. AudioShake bunu açıkça hazır bir karşılaştırma olarak çerçevelendirir, eşleşen eğitim koşulları altında bir mimarinin doğası gereği daha üstün olduğunu kanıtlamaktan ziyade. Değerlendirmesi ayrıca, sürekli örtüşme ve konuşmacı sayısı arttıkça doğruluğun korunmasının daha zor hale geldiğini belirtir.
Bunlar şirket tarafından raporlanan sonuçlardır, her Refinery dağıtımının bağımsız bir değerlendirmesi değildir. Teknolojiyi temsilci sesler üzerinde test etmeyi desteklerler, başlıkta belirtilen iyileşmenin başka bir veri kümesine değişmeden aktarılacağını varsaymak yerine.
Ayırma kalitesi ve aşağı akış model performansı da farklı sonuçlardır. Daha temiz bir eğitim korpusu değerli olabilir, ancak lansman belirli bir konuşma modelinin ondan öğrenme sonrası ne kadar iyileşeceğini ortaya koymaz. Bunun için amaçlanan uygulama ve değerlendirme koşulları tanımlanmış ayrı bir deney gerekir.
Medya İş Akışlarından AI Veri Altyapısına
AudioShake müzik ve medya prodüksiyonundan deneyim getiriyor. şirket web sitesi, miksleme, yerelleştirme, ses analizi ve ses‑görüntü düzenleme gibi görevler için ses ayrımını tanımlıyor ve ESPN, Universal Music Group ve Warner Bros. Studios gibi müşterileri listeliyor. Bu ortamlarda, tamamlanmış bir miksten öğeleri ayırmak, mevcut materyali başka bir üretim iş akışı için faydalı hâle getirebilir.
Refinery, AI geliştirmesine benzer bir fikir uygular: mevcut bir kaydı bileşenlerini ortaya çıkararak daha faydalı hâle getirmek. AudioShake’in veri hizmetleri sayfası ayrıca müşterilerin kendi içeriklerinden veri setleri hazırlamayı ve belirli kataloglar için özelleştirilmiş ayrım modelleri geliştirmeyi tanımlar.
Bu, her medya arşivini uygun bir eğitim veri seti yapmaz. Organizasyonların hâlâ hangi kayıtların amaçlanan kullanımına uygun olduğunu belirlemeleri ve materyalle ne yapmalarına izin verildiğini ortaya koymaları gerekir. Duyuru özellikle The Refinery’yi, zaten kullanım haklarına sahip ses müşterileri etrafında konumlandırıyor.
Ses AI Geliştiricileri İçin Pratik Bir Test
Başlangıç blogunda, AudioShake 100 milyondan fazla dakikanın işlendiğini rapor ediyor ve erken sürümlerin geçen yıl boyunca sınırdaki AI laboratuvarlarıyla özel olarak dağıtıldığını belirtiyor. Müşteriler arasında Luel ve Rime’i, isimsiz laboratuvarlar ve veri pazarlarıyla birlikte adlandırıyor. Ölçek, şirket tarafından bildirilen bir rakam olarak kalıyor.
Duyuruya göre, Refinery, AudioShake’in API’si aracılığıyla veri işleyebilir veya yerinde dağıtılabilir. İkinci seçenek, organizasyonların hassas veya sahipli kayıtlara kendi ortamlarında işlem yapmalarını sağlamayı amaçlar. Müşteriler verilerinin ve çıktılarının sahipliğini korur.
Bir geliştiricinin sistemi değerlendirmesi için, temsilci bir deneme, tamamen temiz bir gösterimden daha önemli olur. Yararlı sorular arasında sessiz konuşmacıların ayrımda ayakta kalıp kalmadığı, kesintilerin hizalanmış kalıp kalmadığı, ne kadar manuel düzeltme gerektiği ve ortaya çıkan örneklerin amaçlanan ses uygulamasını iyileştirip iyileştirmediği yer alır.
AudioShake’in lansman blogu yaklaşımı hakkında ek arka plan sağlar. The Refinery’nin daha geniş önemi açıktır: gerçek konuşma, karışık bir kaydın gizleyebileceği faydalı bir yapı içerir. Bu yapıyı geri kazanmak, mevcut sesi, insanların gerçekten konuştuğu şekilde çalışan ses AI’sı oluşturmak için daha pratik bir kaynak hâline getirebilir.












