Yapay zeka modelleri ve platformları
Filmler ve Diğer Medya İçin Ses Efektleri Oluşturmak İçin AI Araştırmacıları Program Tasarladı
Texas San Antonio Üniversitesi’nden araştırmacılar, bir video中的 eylemleri gözlemleyen ve bu eylemlere uygun yapay ses efektleri oluşturabilen bir AI tabanlı uygulama geliştirdiler. Program tarafından oluşturulan ses efektlerinin o kadar gerçekçi olduğu bildiriliyor ki, insan gözlemcilerin anketine katılanlar genellikle ses efektlerinin gerçek olduğunu düşündüler.
Ses efektlerini oluşturan program, AudioFoley, yakın zamanda IEEE Transactions on Multimedia’da yayınlanan bir çalışmada ayrıntılı olarak anlatıldı. IEEE Spectrum’a göre, AI programı, UT San Antonio’dan Jeff Provost ve Ph.D. öğrencisi Sanchita Ghose tarafından geliştirildi. Araştırmacılar, programı, birden fazla makine öğrenimi modelini birleştirerek oluşturdular.
Ses efektlerini oluşturmanın ilk adımı, ekrandaki eylemleri tanımlamak ve bunları ses efektlerine eşlemekti. Bunu başarmak için, araştırmacılar iki farklı makine öğrenimi modeli tasarladılar ve farklı yaklaşımlarını test ettiler. İlk model, videoya alınan çerçeveleri çıkararak ve bu çerçeveleri ilgili özellikler gibi hareketler ve renkler için analiz ederek çalışır. Daha sonra, bir nesnenin pozisyonunun çerçeveler arasında nasıl değiştiğini analiz etmek için ikinci bir model kullanıldı, böylece zaman bilgisi çıkarıldı. Bu zaman bilgisi, videodaki sonraki muhtemel eylemleri tahmin etmek için kullanılır. İki model, eylemleri analiz etmek için farklı yöntemlere sahiptir, ancak her ikisi de sesi en iyi şekilde eşleştirmek için klipteki bilgileri kullanır.
Sonraki görev, sesi sentezlemek ve bu, faaliyetleri/predicted hareketleri olası ses örnekleriyle eşleştirmekle gerçekleştirilir. Ghose ve Prevost’a göre, AutoFoley, 1000 kısa klip için ses oluşturmak için kullanıldı ve bu kliplerde ateş, koşan bir at, tikleyen saatler ve yağmurun bitkiler üzerine düşmesi gibi eylemler ve nesneler yer aldı. AutoFoley, eylemler ile sesler arasında mükemmel bir eşleşme gerektirmeyen klipler için ses oluşturmakta en başarılıydı ve eylemler daha fazla varyasyonla gerçekleştiğinde klipler için ses oluşturmada zorluk yaşadı, ancak program hala birçok insan gözlemcisini, oluşturulan sesleri orijinal ses yerine seçmeye ikna edebildi.
Prevost ve Ghose, 57 üniversite öğrencisini işe aldılar ve onlara farklı klipler izlettirdiler. Bazı klipler orijinal sesi içeriyordu, bazıları ise AutoFoley tarafından oluşturulan sesi içeriyordu. İlk model test edildiğinde, yaklaşık olarak %73’ü sentezlenen sesi orijinal ses olarak seçti, gerçek sesi göz ardı etti. Diğer model biraz daha kötü performans gösterdi ve yalnızca %66’sı oluşturulan sesi orijinal ses yerine seçti.
Prevost, AutoFoley’nin potansiyel olarak film, televizyon ve diğer medya parçalarının üretim sürecini hızlandırabileceğini açıkladı. Prevost, gerçekçi bir Foley izinin medyayı çekici ve inandırıcı kılmak için önemli olduğunu, ancak Foley sürecinin genellikle tamamlanması için önemli bir zaman aldığını belirtti. Temel Foley öğelerinin oluşturulmasını ele alan bir otomatik sistem, medyanın üretimini daha ucuz ve daha hızlı hale getirebilir.
Şu anda, AutoFoley bazı önemli sınırlamalara sahiptir. Birincisi, model, öngörülebilir, istikrarlı hareketleri olan olayları gözlemlemekte iyi performans gösterirken, zaman içinde varyasyon olan olaylar için ses oluşturmada zorluk yaşamaktadır (örneğin fırtınalar). Ayrıca, sınıflandırma konusunun tüm klibin içinde bulunması ve kareyi terk etmemesi gerektirir. Araştırma ekibi, bu sorunları gelecekteki uygulama sürümleriyle çözmeyi amaçlıyor.












