Модели и платформы ИИ
Исследователи ИИ Разработали Программу Для Генерации Звуковых Эффектов Для Фильмов и Других СМИ
Исследователи из Университета Техаса в Сан-Антонио создали приложение на основе ИИ, способное наблюдать за действиями, происходящими в видео, и создавать искусственные звуковые эффекты, соответствующие этим действиям. Звуковые эффекты, сгенерированные программой, якобы настолько реалистичны, что когда были опрошены человеческие наблюдатели, они обычно считали звуковые эффекты подлинными.
Программа, ответственная за генерацию звуковых эффектов, AudioFoley, была подробно описана в недавно опубликованном исследовании в IEEE Transactions on Multimedia. Согласно IEEE Spectrum, программу ИИ разработали Джефф Превост, профессор Университета Техаса в Сан-Антонио, и аспирант Санчита Гхозе. Исследователи создали программу, используя несколько моделей машинного обучения, объединенных вместе.
Первой задачей в генерации звуковых эффектов, подходящих для действий на экране, было распознавание этих действий и сопоставление их со звуковыми эффектами. Для этого исследователи разработали две разные модели машинного обучения и протестировали их различные подходы. Первая модель работает путем извлечения кадров из видео, которое она получает, и анализа этих кадров на предмет релевантных особенностей, таких как движения и цвета. Затем вторая модель была использована для анализа того, как положение объекта меняется между кадрами, чтобы извлечь временную информацию. Эта временная информация используется для предсказания следующих вероятных действий в видео. Обе модели имеют разные методы анализа действий в клипе, но они обе используют информацию, содержащуюся в клипе, чтобы угадать, какой звук лучше всего сопровождать его.
Следующей задачей является синтез звука, который осуществляется путем сопоставления действий/предсказанных движений с возможными звуковыми образцами. Согласно Гхозе и Превосту, AutoFoley была использована для генерации звука для 1000 коротких клипов, в которых были представлены действия и предметы, такие как огонь, бегущий конь, тикающие часы и дождь, падающий на растения. Хотя AutoFoley была наиболее успешной в создании звука для клипов, где не требовалось идеальное совпадение между действиями и звуками, и она испытывала трудности при сопоставлении клипов, где действия происходили с большим разнообразием, программа все же смогла обмануть многих человеческих наблюдателей, заставив их выбрать сгенерированные звуки вместо исходного звука, сопровождавшего клип.
Превост и Гхозе набрали 57 студентов колледжа и показали им различные клипы. Некоторые клипы содержали исходный аудио, некоторые содержали аудио, сгенерированное AutoFoley. Когда была протестирована первая модель, примерно 73% студентов выбрали синтезированный аудио как исходный аудио, не обращая внимания на настоящий звук, сопровождавший клип. Другая модель показала немного худшие результаты, с только 66% участников, выбравших сгенерированный аудио вместо исходного аудио.
Превост объяснил, что AutoFoley потенциально может быть использована для ускорения процесса производства фильмов, телевидения и других произведений СМИ. Превост отмечает, что реалистичный звуковой эффект важен для того, чтобы сделать СМИ привлекательными и правдоподобными, но процесс создания звуковых эффектов часто занимает значительное количество времени. Имея автоматизированную систему, которая могла бы создавать основные элементы звуковых эффектов, производство СМИ могло бы стать дешевле и быстрее.
В настоящее время AutoFoley имеет некоторые заметные ограничения. Во-первых, хотя модель, кажется, работает хорошо при наблюдении событий с стабильными, предсказуемыми движениями, она испытывает трудности при генерации аудио для событий с разнообразием во времени (например, гроз). Кроме того, она также требует, чтобы классифицируемый предмет присутствовал во всем клипе и не покидал кадр. Исследовательская команда направлена на решение этих проблем в будущих версиях приложения.












