Góc nhìn Anderson

Xác định Nội dung Video Có hại với Trailer Phim và Học máy

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một bài báo nghiên cứu từ Hội đồng Truyền thông Thụy Điển phác thảo một cách tiếp cận mới có thể để xác định tự động ‘nội dung có hại’, bằng cách xem xét nội dung âm thanh và video riêng biệt, và sử dụng dữ liệu được chú thích bởi con người như một chỉ số hướng dẫn cho tài liệu có thể gây khó chịu cho người xem.

Được gọi là Đây có phải là có hại? Học cách Dự đoán Xếp hạng Có hại từ Video, bài báo minh họa nhu cầu của các hệ thống học máy phải tính đến toàn bộ ngữ cảnh của một cảnh, và minh họa nhiều cách mà nội dung vô hại (như nội dung hài hước hoặc châm biếm) có thể bị hiểu lầm là có hại trong một cách tiếp cận ít tinh vi và đa phương tiện hơn để phân tích video – không ít vì bản nhạc âm thanh của một bộ phim thường được sử dụng theo những cách không mong muốn, hoặc để làm cho người xem cảm thấy không an toàn hoặc an tâm, và như một phản điểm chứ không phải là một sự bổ sung cho thành phần hình ảnh.

Tập dữ liệu của các Video Có thể Có hại

Các nhà nghiên cứu lưu ý rằng những phát triển hữu ích trong lĩnh vực này đã bị cản trở bởi sự bảo vệ bản quyền của các bộ phim, điều này làm cho việc tạo ra các tập dữ liệu mã nguồn mở tổng quát trở nên khó khăn. Họ cũng quan sát thấy rằng cho đến nay, các thí nghiệm tương tự đã gặp phải sự thiếu hụt của các nhãn cho các bộ phim đầy đủ, điều này đã dẫn đến việc các công việc trước đó oversimplifying dữ liệu đóng góp, hoặc tập trung vào chỉ một khía cạnh của dữ liệu, chẳng hạn như màu sắc thống trị hoặc phân tích đối thoại.

Để giải quyết vấn đề này, các nhà nghiên cứu đã biên soạn một tập dữ liệu video của 4000 đoạn video, các đoạn trailer được cắt thành các đoạn khoảng mười giây, sau đó được gắn nhãn bởi các nhà phân loại phim chuyên nghiệp giám sát việc áp dụng xếp hạng cho các bộ phim mới ở Thụy Điển, nhiều người trong số họ có trình độ chuyên môn trong tâm lý học trẻ em.

Theo hệ thống phân loại phim của Thụy Điển, ‘nội dung có hại’ được định nghĩa dựa trên khả năng có thể gây ra cảm giác lo lắng, sợ hãi và các tác động tiêu cực khác ở trẻ em. Các nhà nghiên cứu lưu ý rằng vì hệ thống xếp hạng này liên quan đến trực giác và bản năng cũng như khoa học, các tham số cho định nghĩa của ‘nội dung có hại’ là khó để định lượng và đưa vào một hệ thống tự động.

Định nghĩa về Có hại

Bài báo còn lưu ý rằng các hệ thống học máy và thuật toán trước đó giải quyết thách thức này đã sử dụng phát hiện đặc điểm cụ thể như một tiêu chí, bao gồm phát hiện hình ảnh của máu và ngọn lửa, âm thanh của tiếng nổ, và tần suất của độ dài cảnh, trong số các định nghĩa hạn chế khác về nội dung có hại, và rằng một cách tiếp cận đa lĩnh vực có vẻ sẽ cung cấp một phương pháp tốt hơn cho việc xếp hạng tự động của nội dung có hại.

Các nhà nghiên cứu Thụy Điển đã đào tạo một mô hình mạng nơ-ron 8×8 50 lớp trên điểm chuẩn chuyển động của con người Kinetics-400 dataset, và tạo ra một kiến trúc được thiết kế để kết hợp dự đoán video và âm thanh.

Trên thực tế, việc sử dụng trailer giải quyết ba vấn đề cho việc tạo ra một tập dữ liệu như vậy: nó loại bỏ các vấn đề về bản quyền; tần suất cao hơn và tần suất cảnh cao hơn của trailer (so với các bộ phim gốc), cho phép tần suất chú thích cao hơn; và nó đảm bảo rằng sự xuất hiện thấp của nội dung bạo lực hoặc gây khó chịu trong một bộ phim hoàn chỉnh không làm mất cân bằng tập dữ liệu và vô tình phân loại nó là phù hợp với trẻ em.

Kết quả

Một khi mô hình đã được đào tạo, các nhà nghiên cứu Thụy Điển đã thử nghiệm hệ thống chống lại các đoạn video.

Trong đoạn trailer này của The Deep (2012), hai mô hình được sử dụng để thử nghiệm hệ thống (nhãn được lấy mẫu ngẫu nhiên so với nhãn xác suất) đã phân loại thành công bộ phim là phù hợp với người xem từ 11 tuổi trở lên.

Nguồn: https://arxiv.org/pdf/2106.08323.pdf

Nguồn: https://arxiv.org/pdf/2106.08323.pdf

Đối với một cảnh từ Discarnate (2018) nơi một nhân vật phản diện được giới thiệu, khuôn khổ kép lại ước tính đúng phạm vi tuổi mục tiêu là 11+/15+.

Tuy nhiên, một đoạn từ trailer của A Second Chance (2014) đã gây ra khó khăn hơn, vì mô hình không thể đồng ý với chú thích của con người cho cảnh, đã phân loại nó là ‘BT’ (chấp nhận được trên toàn cầu). Trên thực tế, thuật toán đã phát hiện ra khả năng gây hại mà các nhà đánh giá con người không gán cho nó.

Mặc dù các nhà nghiên cứu tuyên bố một điểm số chính xác cao cho hệ thống, một số thất bại đã xảy ra, chẳng hạn như đoạn này từ City State (2011), có một người đàn ông bị giam giữ bị đe dọa bởi một khẩu súng.

Trong trường hợp này, hệ thống đã gán một xếp hạng 11+ cho đoạn, trái với chú thích của con người.

Sự không đồng nhất giữa Ý định và Tính có hại

Bài báo lưu ý rằng khi đánh giá một đoạn từ trailer của Paydirt (2020), hệ thống đã gán đúng một xếp hạng ‘toàn cầu’ cho đoạn dựa trên các khía cạnh hình ảnh và ngôn ngữ (mặc dù các nhân vật đang thảo luận về vũ khí, ý định là hài hước), nhưng bị nhầm lẫn bởi âm nhạc đe dọa không đồng nhất được sử dụng, có thể có một ngữ cảnh châm biếm.

Tương tự như trong trailer của bộ phim For Sama (2019), phong cách âm nhạc đe dọa không được khớp với nội dung hình ảnh, và một lần nữa, hệ thống gặp khó khăn trong việc phân tách hai thành phần để đưa ra một phán quyết thống nhất bao gồm cả nội dung âm thanh và hình ảnh của đoạn.

Cuối cùng, hệ thống đã điều hướng đúng sự không đồng nhất giữa âm thanh và video trong một đoạn trailer cho Virgin Mountain (2015), có chứa một số tín hiệu hình ảnh đe dọa (ví dụ: một cửa sổ bị vỡ) bị suy yếu bởi âm nhạc. Do đó, khuôn khổ đã đoán đúng rằng đoạn được xếp hạng ‘toàn cầu’ (BT).

Các nhà nghiên cứu thừa nhận rằng một hệ thống như vậy chỉ tập trung vào trẻ em, với kết quả không thể khái quát hóa tốt cho các loại người xem khác. Họ cũng đề xuất rằng việc mã hóa ‘nội dung có hại’ theo cách tuyến tính này có thể dẫn đến các hệ thống xếp hạng thuật toán ít khó đoán hơn, nhưng lưu ý tiềm năng cho sự đàn áp không mong muốn của ý tưởng trong việc phát triển các cách tiếp cận như vậy:

‘Đánh giá xem nội dung có hại là một vấn đề tế nhị. Có một sự cân bằng quan trọng giữa tự do thông tin và bảo vệ các nhóm nhạy cảm. Chúng tôi tin rằng công việc này đang đi đúng hướng, bằng cách minh bạch nhất có thể về các tiêu chí được sử dụng để đánh giá mức độ có hại. Hơn nữa, chúng tôi tin rằng việc tách biệt có hại khỏi sự phù hợp là một bước quan trọng để làm cho việc phân loại nội dung có hại trở nên khách quan hơn.

‘… Phát hiện nội dung có hại cũng là của interest đến các nền tảng trực tuyến như YouTube. Trên các nền tảng như vậy, sự cân bằng giữa tự do thông tin và bảo vệ trở nên quan trọng hơn và bị phức tạp hóa bởi bản chất độc quyền của các thuật toán chịu trách nhiệm.’

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai