Взгляд Anderson

Определение вредного видеоконтента с помощью трейлеров фильмов и машинного обучения

mm
Добавьте Unite.AI в избранные источники в Google

Исследовательская работа Шведского медиа-совета описывает возможный новый подход к автоматической идентификации «вредного контента», учитывая аудио- и видеоконтент отдельно и используя данные, аннотированные людьми, в качестве ориентира для материала, который может беспокоить зрителей.

Названная Это вредно? Обучение прогнозированию вредности видео, статья иллюстрирует необходимость для систем машинного обучения учитывать весь контекст сцены и показывает многочисленные способы, которыми безобидный контент (например, юмористический или сатирический контент) может быть неправильно истолкован как вредный в менее совершенной и многомодальной подходе к анализу видео – не в последнюю очередь потому, что музыкальный саундтрек фильма часто используется неожиданным образом, либо для того, чтобы наруšit или успокоить зрителя, и как контрапункт, а не дополнение к визуальной компоненте.

Датасет потенциально вредных видео

Исследователи отмечают, что полезные разработки в этом секторе были затруднены из-за защиты авторских прав фильмов, что делает создание общедоступных открытых датасетов проблематичным. Они также наблюдают, что до сих пор подобные эксперименты страдали от скудости меток для полнометражных фильмов, что привело к упрощению данных или сосредоточению внимания только на одном аспекте данных, таком как доминирующие цвета или анализ диалога.

Чтобы решить эту проблему, исследователи составили видеодатасет из 4000 видеоклипов, трейлеров, разрезанных на кусочки длиной около десяти секунд, которые затем были помечены профессиональными фильм- классификаторами, которые контролируют применение рейтингов для новых фильмов в Швеции, многие из которых имеют профессиональные квалификации в области детской психологии.

В соответствии с шведской системой классификации фильмов, «вредный» контент определяется на основе его возможной способности вызывать чувства тревоги, страха и других негативных эффектов у детей. Исследователи отмечают, что поскольку эта система рейтингов включает столько же интуиции и инстинкта, сколько и науки, параметры определения «вредного контента» трудно количественно оценить и внедрить в автоматизированную систему.

Определение вреда

Статья进一步 отмечает, что ранее системы машинного обучения и алгоритмические системы, решающие эту задачу, использовали конкретное обнаружение аспектов в качестве критерия, включая визуальное обнаружение крови и пламени, звук взрыва и частоту смены кадров, среди других ограниченных определений вредного контента, и что многодоменный подход, кажется, предлагает лучшую методологию для автоматической оценки вредного контента.

Шведские исследователи обучили 8×8 50-слойную нейронную сеть на бенчмарке Kinetics-400 датасете и создали архитектуру, предназначенную для объединения видео- и аудиопредсказаний.

По сути, использование трейлеров решает три проблемы для создания датасета этого типа: оно устраняет проблемы с авторскими правами; увеличенная турбулентность и более высокая частота смены кадров трейлеров (по сравнению с исходными фильмами) позволяет более часто аннотировать; и оно гарантирует, что низкая частота насилия или тревожного контента в整个 фильме не приведет к несбалансированности датасета и случайному классифицированию его как подходящего для детей.

Результаты

После того, как модель была обучена, шведские исследователи протестировали систему на видеоклипах.

В этом трейлере для Глубина (2012) две модели, использованные для тестирования системы (случайно выбранные метки и вероятностные метки), успешно классифицировали фильм как подходящий для зрителей старше 11 лет.

Источник: https://arxiv.org/pdf/2106.08323.pdf

Источник: https://arxiv.org/pdf/2106.08323.pdf

Для сцены из Дискарнат (2018), где представлен монструозный антагонист, двойная структура снова правильно оценила целевую возрастную группу как 11+/15+.

Однако клип из трейлера для Второй шанс (2014) представил большую трудность, поскольку модель не смогла согласиться с человеческими аннотациями для сцены, которая была классифицирована как «BT» (универсально приемлемая). По сути, алгоритм обнаружил потенциал вреда, который человеческие оценщики не приписали ему.

Хотя исследователи подтверждают высокий уровень точности системы, некоторые неудачи произошли, такие как этот клип из Городской государства (2011), который представляет собой задержанного обнаженного человека, угрожаемого винтовкой.

В этом случае система присвоила клипу рейтинг 11+, в отличие от человеческих аннотаций.

Диссонанс намерения и вредности

Статья отмечает, что при оценке клипа из трейлера для Платеж (2020) система правильно присваивает «универсальный» рейтинг клипу на основе визуальных и лингвистических аспектов (хотя персонажи обсуждают огнестрельное оружие, намерение комическое), но запутана диссонансно угрожающей музыкой, используемой, которая может иметь сатирический контекст.

Аналогично в трейлере для фильма Для Самы (2019) угрожающий стиль музыкального контента не соответствует визуальному контенту, и снова система испытывает трудности в разъединении двух компонентов, чтобы сделать единый суд, покрывающий как аудио-, так и видеоконтент клипа.

Наконец, система правильно ориентируется в аудио/видео диссонансе в трейлерном клипе для Горная девственница (2015), который содержит некоторые угрожающие визуальные сигналы (например, разбитое окно), которые подрываются музыкой. Таким образом, структура правильно угадывает, что клип имеет рейтинг «универсальный» (BT).

Исследователи признают, что система этого типа исключительно ориентирована на детей, и результаты вряд ли будут хорошо обобщаться для других типов зрителей. Они также предлагают, что кодификация «вредного» контента таким линейным образом может потенциально привести к алгоритмическим системам рейтинга, которые менее непредсказуемы, но отмечают потенциал для нежелательного подавления идей при разработке таких подходов:

«Оценка того, является ли контент вредным, – это деликатный вопрос. Существует важный баланс между свободой информации и защитой чувствительных групп. Мы считаем, что эта работа делает шаг в правильном направлении, будучи как можно более прозрачной о критериях, используемых для оценки вредности. Кроме того, мы считаем, что разделение вредности и приемлемости является важным шагом на пути к тому, чтобы сделать классификацию вредного контента более объективной.

«… Обнаружение вредного контента также представляет интерес для онлайн-платформ, таких как YouTube. На таких платформах баланс между свободой информации и защитой становится еще более важным и еще больше осложняется из-за проприетарной природы алгоритмов, ответственных за это.»

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai