Моделі та платформи ШІ
Дослідники з розробки штучного інтелекту створили програму для генерації звукових ефектів для фільмів та інших медіа
Дослідники з Університету Техасу в Сан-Антоніо створили програму на основі штучного інтелекту, яка здатна спостерігати за діями, що відбуваються у відео, та створювати штучні звукові ефекти, які відповідають цим діям. Звукові ефекти, згенеровані програмою, нібито настільки реалістичні, що коли людей запитали про це, вони часто думали, що звукові ефекти справжні.
Програма, яка відповідає за генерацію звукових ефектів, AudioFoley, була детально описана в дослідженні, опублікованому нещодавно в IEEE Transactions on Multimedia. За даними IEEE Spectrum, програму штучного інтелекту розробили Джεφ Превост, професор Університету Техасу в Сан-Антоніо, та аспірант Санчіта Гхозе. Дослідники створили програму, використовуючи кілька моделей машинного навчання, об’єднаних разом.
Першим завданням при генерації звукових ефектів, відповідних діям на екрані, було визнання цих дій та їхнє зіставлення зі звуковими ефектами. Для цього дослідники розробили дві різні моделі машинного навчання та протестували їхні різні підходи. Перша модель працює шляхом витягування кадрів з відео, яке їй подається, та аналізу цих кадрів на відповідні ознаки, такі як рухи та кольори. Після цього друга модель використовується для аналізу того, як змінюється положення об’єкта через кадри, щоб витягнути часову інформацію. Ця часова інформація використовується для передбачення наступних ймовірних дій у відео. Обидві моделі мають різні методи аналізу дій у кліпі, але вони обоє використовують інформацію, що міститься у кліпі, щоб здогадатися, який звук найкраще супроводжуватиме його.
Наступним завданням є синтез звуку, який здійснюється шляхом зіставлення діяльності/передбачуваних рухів із можливими зразками звуків. За словами Гхозе та Превоста, AutoFoley була використана для генерації звуку для 1000 коротких кліпів, що містять дії та предмети, такі як вогонь, біжить кінь, тикають годинники та дощ, що падає на рослини. Хоча AutoFoley була найбільш успішною у створенні звуку для кліпів, де не потрібно було ідеального збігання між діями та звуками, і вона мала труднощі з кліпами, де дії відбувалися з більшою варіативністю, програма все ж змогла обманути багатьох людей, змусивши їх вибирати згенеровані звуки замість тих, що супроводжували кліп спочатку.
Превост та Гхозе запросили 57 студентів коледжу та попросили їх переглянути різні кліпи. Деякі кліпи містили оригінальний аудіо, деякі містили аудіо, згенероване AutoFoley. Коли була протестована перша модель, приблизно 73% студентів вибрали синтезований аудіо як оригінальний аудіо, не помічаючи справжній звук, який супроводжував кліп. Інша модель показала трохи гірші результати, з лише 66% учасників, які вибрали згенерований аудіо замість оригінального аудіо.
Превост пояснив, що AutoFoley потенційно може бути використана для прискорення процесу виробництва фільмів, телебачення та інших медіа. Превост зазначає, що реалістична звукова доріжка важлива для того, щоб медіа були привабливими та правдоподібними, але процес створення звукових ефектів часто займає значну кількість часу. Маємо автоматизовану систему, яка могла б займатися створенням базових елементів звукових ефектів, це могло б зробити виробництво медіа дешевшим та швидшим.
Наразі AutoFoley має деякі помітні обмеження. По-перше, хоча модель здається добре працює при спостереженні за подіями, що мають стабільні, передбачувані рухи, вона страждає, коли намагається згенерувати аудіо для подій з варіативністю у часі (наприклад, гроз). Крім того, вона також вимагає, щоб об’єкт класифікації був присутній у всьому кліпі та не залишав кадр. Команда дослідників спрямована на вирішення цих питань у майбутніх версіях програми.












