Góc nhìn Anderson

Tìm kiếm Trí tuệ nhân tạo có thể theo dõi toàn bộ bộ phim

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
AI-generated illustration (GPT-1.5) depicting a POV of a Steenbeck flatbed editing table as robot hands examine celluloid footage of a love scene from an old movie.

Các mô hình trí tuệ nhân tạo vẫn mất dấu ai là ai và những gì đang xảy ra trong một bộ phim. Một hệ thống mới sắp xếp nhận dạng khuôn mặt và tóm tắt phân cảnh, giữ cho các nhân vật thẳng và cốt truyện nhất quán trên toàn bộ phim.

 

Làm cho trí tuệ nhân tạo xem và hiểu các bộ phim theo phong cách Hollywood có thể giống như một nhiệm vụ nhỏ hoặc không quan trọng; nhưng một hệ thống có thể xem một bộ phim đầy đủ từ đầu đến cuối, theo dõi tiến trình của tất cả các nhân vật và giữ trên đỉnh của cốt truyện, đã không chỉ làm cho một số ứng dụng trực tiếp có thể được hưởng lợi từ khả năng này, mà còn một số thách thức không liên quan, trên các lĩnh vực khác nhau.

Trái cây thấp cho các mô hình trí tuệ nhân tạo xem phim là hệ thống khuyến nghị, trên các nền tảng phát trực tuyến như Netflix, Amazon Prime và HBO Max. Một sự hiểu biết chi tiết về sự phát triển của cốt truyện và hành động của nhân vật cho phép phù hợp hơn với sở thích và niềm đam mê của người xem.

Hơn nữa, một sự hiểu biết sâu sắc hơn về một bộ phim cho phép tạo ra từ khóa và phân loại chính xác hơn, thay vì duy trì các mô tả bộ phim đã được sao chép nhiều lần, có thể đã được viết cách đây nhiều thập kỷ. Những thông tin này cũng có thể tiết lộ sự hiện diện của các chủ đề “người lớn” trong một bộ phim, điều mà không rõ ràng từ đối thoại hoặc hình ảnh.

Ngoài ra, các bộ phim cũ trong danh mục có thể có xếp hạng và tóm tắt lỗi thời; ví dụ, ngôn ngữ và thành ngữ được chuẩn hóa trong một bộ phim của những năm 1950 có thể đòi hỏi sự chú ý nhiều hơn bây giờ. Nhưng không có sự hiểu biết chung về ngữ cảnh, thu được từ việc theo dõi một câu chuyện dài, những sự việc này có thể được nhấn mạnh quá mức hoặc không đủ.

Hơn nữa, các phương pháp phân tích bộ phim cải tiến có thể đóng góp rất nhiều vào vấn đề rộng lớn hơn của nhận dạng sự kiện, điều cần thiết cho các đổi mới trong giám sát an ninh, bình luận thể thao tự động và tóm tắt của tất cả các loại, trên một loạt các phương tiện.

Vì vậy, ‘trí tuệ nhân tạo xem phim’ là một thể loại khá phổ biến trong văn học về Thị giác Máy tính.

Nhìn thấy bức tranh lớn

Người mới tham gia vào lĩnh vực này là MovieTeller – một sự hợp tác giữa học thuật và công nghiệp từ Trung Quốc, tạo ra tiến bộ mới bằng cách chia nhỏ các nhiệm vụ con trong thách thức trên các ứng dụng trí tuệ nhân tạo khác nhau phù hợp với những thách thức này, thay vì – như thường thấy – cố gắng đào tạo các mô hình rời rạc và bao gồm có thể thực hiện tất cả các nhiệm vụ cần thiết từ một không gian tiềm ẩn duy nhất.

Các tác giả quan sát rằng các mô hình Trí tuệ nhân tạo – Ngôn ngữ trước đây đối mặt với cùng một nhiệm vụ đã không thể tiến bộ quá xa khỏi phân tích khung hình đơn; và rằng sự thiếu hụt ngữ cảnh của chúng làm cho nó khó khăn cho các mô hình này để xác định nhất quán các nhân vật – có lẽ là đặc điểm quan trọng nhất của một hệ thống như vậy:

Hệ thống mới, MovieTeller, có thể xác định nhất quán các người trong cảnh, nhờ vào việc sử dụng một hệ thống nhận dạng khuôn mặt chuyên dụng; nhưng chính sự cam kết bao quát hơn đối với ngữ cảnh cho phép khuôn khổ này giữ trên đỉnh của sự phát triển của cốt truyện. Nguồn - https://arxiv.org/pdf/2602.23228

Hệ thống mới, MovieTeller, có thể xác định nhất quán các người trong cảnh, nhờ vào việc sử dụng một hệ thống nhận dạng khuôn mặt chuyên dụng; nhưng chính sự cam kết bao quát hơn đối với ngữ cảnh cho phép khuôn khổ này giữ trên đỉnh của sự phát triển của cốt truyện. Nguồn

Các tác giả tuyên bố:

‘Các mô hình Trí tuệ nhân tạo – Ngôn ngữ chung thường gặp khó khăn trong việc nhận dạng và theo dõi nhất quán các nhân vật cụ thể trong suốt một câu chuyện dài. Chúng có thể mô tả một nhân vật chính là “một người đàn ông” trong một cảnh và “một người” trong một cảnh khác, không thể ràng buộc đại diện trực quan với một danh tính nhất quán.’

Các tác giả lưu ý rằng vì cơ chế tự chú ý của Transformer sử dụng phức tạp tính toán bậc hai, việc xử lý mọi khung hình của một bộ phim đầy đủ tại một thời điểm trở nên quá tốn kém về mặt tính toán. Do đó, các phương pháp dựa trên việc lấy mẫu khung hình đồng đều hoặc đơn giản hóa tend to phá vỡ dòng chảy của câu chuyện, tạo ra các tóm tắt bị phân mảnh thay vì một câu chuyện nhất quán.

Thay vào đó, hệ thống mới bao gồm một đường ống đào tạo không cần thiết, với các công cụ chuyên dụng để giải quyết nhận dạng khuôn mặt và sự nhất quán của bộ nhớ (khi các nhân vật rời khỏi và tái nhập vào câu chuyện của một bộ phim).

MovieTeller đã được thử nghiệm chống lại các phương pháp trước đó bằng cách sử dụng 60 bộ phim đầy đủ, tương đương với 10.000 phút phim. Trong các thử nghiệm ablation định lượng và nghiên cứu của con người, các tác giả báo cáo, phương pháp của họ đã có thể cải thiện đáng kể so với các môi trường và giả định mặc định được sử dụng bởi các hệ thống trước đó.

Bản bản thảo mới có tiêu đề MovieTeller: Tool-augmented Movie Synopsis với ID Consistent Progressive Abstraction, và đến từ năm tác giả trên Zhejiang University tại Hangzhou, nhóm truyền thông quốc gia Trung Quốc và Watch AI Group* (hai nhóm sau dựa tại Bắc Kinh).

Phương pháp

Khuôn khổ MovieTeller bao gồm ba giai đoạn: phân đoạn cảnh và trích xuất khung hình chính, được xử lý thông qua PySceneDetect; Factual-Grounded Scene Description Generation thông qua việc tùy chỉnh Qwen2.5-VL-7B-Instruct VLM; và progressive abstraction, condenses các mô tả cảnh chi tiết thành tóm tắt chương và sau đó thành một tóm tắt tổng thể nhất quán – và điều này cũng được thực hiện bởi mô hình Qwen2.5:

Tổng quan về khuôn khổ MovieTeller: một bộ phim đầy đủ được phân đoạn thành các cảnh và cô đặc thành các khung hình chất lượng cao; sau đó, một công cụ nhận dạng khuôn mặt bên ngoài tiêm các nền tảng thực tế, liên kết tên nhân vật với các hộp giới hạn, hướng dẫn một Mô hình Ngôn ngữ - Hình ảnh trong việc tạo ra các mô tả cảnh nhất quán với ID.

Tổng quan về khuôn khổ MovieTeller: một bộ phim đầy đủ được phân đoạn thành các cảnh và cô đặc thành các khung hình chất lượng cao; sau đó, một công cụ nhận dạng khuôn mặt bên ngoài tiêm các nền tảng thực tế, liên kết tên nhân vật với các hộp giới hạn, hướng dẫn một Mô hình Ngôn ngữ – Hình ảnh trong việc tạo ra các mô tả cảnh nhất quán với ID.

Giai đoạn đầu tiên sử dụng PySceneDetect để chia bộ phim thành các cảnh rời rạc, dựa trên các thay đổi trực quan rõ ràng, với mỗi cảnh được đại diện bởi một khung hình chính.

Tuy nhiên, không mọi khung hình đều là một hình ảnh tóm tắt tốt, vì các khoảnh khắc chuyển tiếp, mờ dần và khung hình tối có thể làm混 lẫn các phân tích sau. Do đó, một kiểm tra chất lượng đơn giản thực hiện một bộ lọc trên các khung hình ứng viên, bằng cách đo độ sáng và sự thay đổi trực quan, đảm bảo rằng chỉ các hình ảnh giàu thông tin được chọn để mô tả.

Đặt khuôn mặt

Một cơ sở dữ liệu khuôn mặt được xây dựng từ thông tin dàn diễn viên công khai, lưu trữ tên của mỗi nhân vật chính cùng với một mã hóa khuôn mặt số nhúng. Khi một khuôn mặt xuất hiện trong một khung hình chính, mã hóa của nó được so khớp với cơ sở dữ liệu, và kết quả gần nhất được chấp nhận nếu nó vượt qua ngưỡng tin cậy. Điều này tạo ra ‘nền tảng thực tế’, liên kết tên với các hộp giới hạn cụ thể.

Đối với mục đích này, InsightFace được sử dụng, tận dụng một ArcFace dựa trên đầu nhận dạng mất mát:

Hai khuôn mặt quen thuộc được nhớ rõ bởi Additive Angular Margin Loss (ArcFace) initiative, được sử dụng theo cách tương tự cho dự án MovieTeller. Nguồn - https://www.youtube.com/watch?v=y-D1tReryGA&t=80s

Hai khuôn mặt quen thuộc được nhớ rõ bởi Additive Angular Margin Loss (ArcFace) initiative, được sử dụng theo cách tương tự cho dự án MovieTeller. Nguồn

Các khung hình chính được chú thích sau đó được chuyển đến mô hình Qwen với một lời nhắc liệt kê các nhân vật được phát hiện và vị trí của chúng:

Vì các Mô hình Ngôn ngữ – Hình ảnh không thể hấp thụ toàn bộ một bộ phim đầy đủ trong một lần, MovieTeller ban đầu chia nhỏ vật liệu thành các mô tả cảnh. Những mô tả này được nhóm thành các khối chương như nhau, sau đó được chuyển đến Qwen2.5, mô hình này tóm tắt mỗi chương, nén các sự phát triển của cốt truyện, động cơ của nhân vật và điểm quay, trong khi vẫn giữ tên nhân vật đã được xác minh trước đó.

Các tóm tắt chương được nén sau đó được kết hợp và trả lại cho mô hình với một lời nhắc mới yêu cầu một tóm tắt tổng thể:

Một mẫu lời nhắc được sử dụng để tạo ra các mô tả cảnh, tiêm các tên nhân vật được xác minh và các hộp giới hạn để ràng buộc Mô hình Ngôn ngữ - Hình ảnh và thực thi việc kể chuyện nhất quán với ID.

Giống như lời nhắc yêu cầu một tóm tắt tổng thể, mẫu này được sử dụng để tạo ra mô tả cảnh, tiêm các tên nhân vật được xác minh và các hộp giới hạn để ràng buộc Mô hình Ngôn ngữ – Hình ảnh và thực thi việc kể chuyện nhất quán với ID.

Giả sử quá trình đã thành công, đầu ra cuối cùng nên phản ánh một cách nhất quán câu chuyện của bộ phim. Đây là một nhiệm vụ đặc biệt khó khăn trong học máy, vì sự đa dạng của các tóm tắt cốt truyện có thể và phong cách mà chúng có thể được trình bày, cùng với độ dài cần thiết của những điểm dữ liệu này, làm cho nó gần như không thể áp dụng các phương pháp dựa trên sự thật cơ bản.

Dữ liệu và Kiểm tra

Để kiểm tra hệ thống, các tác giả đã tạo ra một tập dữ liệu tùy chỉnh (và không được chỉ định nguồn) gồm 100 bộ phim đầy đủ, tương đương với khoảng 166 giờ phát. Các bộ phim bao gồm Iron Man 3, Farewell My Concubine, Eat Drink Man WomanThe Chronicles of Narnia. Các nhà nghiên cứu yêu cầu rằng tất cả các bộ phim phải có xếp hạng trên 5,0 trên IMDB:

Tổng hợp dữ liệu trên 100 bộ phim, cho thấy sự bao phủ thời gian cân bằng từ 1992 đến 2025, một đa số nhỏ của các tiêu đề không phải tiếng Anh, và một sự phân bố rộng rãi của các thể loại, dẫn đầu là Drama và Action, với sự đại diện trên Sci-Fi, Horror, Comedy, Romance và History.

Tổng hợp dữ liệu trên 100 bộ phim, cho thấy sự bao phủ thời gian cân bằng từ 1992 đến 2025, một đa số nhỏ của các tiêu đề không phải tiếng Anh, và một sự phân bố rộng rãi của các thể loại, dẫn đầu là Drama và Action, với sự đại diện trên Sci-Fi, Horror, Comedy, Romance và History.

Sự đa dạng của các thể loại được giải quyết (xem biểu đồ trên) được thiết kế để ngăn chặn sự thiên vị đối với bất kỳ thể loại nào.

Cơ sở dữ liệu khuôn mặt cho mỗi bộ phim bao gồm hai bức ảnh của các diễn viên chính – một từ một hình ảnh của bộ phim và một từ một bức ảnh liên quan.

Được thực hiện trong Python, các thử nghiệm được chạy trên bốn card đồ họa NVIDIA A40, mỗi card có 48GB VRAM, và với mô hình Qwen2.5 như mô hình VLM trung tâm. Các nghiên cứu ablation†† cũng được thực hiện với các mô hình tiên tiến khác InternVL3-8BWeThink-Qwen2.5VL-7B.

Hệ thống mới này đã được kiểm tra chống lại hai biến thể ablation††: một No-Hint cơ bản, trong đó Mô hình Ngôn ngữ – Hình ảnh tạo ra các mô tả cảnh từ khung hình chính mà không có bất kỳ gợi ý nào về danh tính của nhân vật; và một Name-Only Hint thiết lập, nơi mô hình được cung cấp các tên nhân vật được phát hiện, nhưng không có hộp giới hạn, cho phép các tác giả cô lập sự đóng góp cụ thể của việc xác định không gian đối với sự nhất quán của danh tính và sự mạch lạc của cốt truyện

Về mặt chỉ số, xem xét sự khó khăn của việc áp dụng các phương pháp dựa trên sự thật cơ bản cho các tóm tắt cốt truyện dài, các chỉ số n-gram chồng chéo tiêu chuẩn như ROUGE và BLEU đã được thay thế bằng BERTScore với F1 score, để đo sự tương đồng ngữ nghĩa so với một tóm tắt tham chiếu được rút ra từ ‘một bách khoa toàn thư công cộng’.

Cũng như vậy, Gemini 2.5 Flash được sử dụng để chấm điểm mỗi tóm tắt cho sự trung thực của sự kiện; sự nhất quán của ID và sự đầy đủ; sự mạch lạc của cốt truyện và dòng chảy; và sự cô đọng, với các điểm được tính trung bình trên các chiều.

Cuối cùng, một đánh giá của con người về 50 tóm tắt được lấy mẫu ngẫu nhiên đã được thực hiện bằng cách so sánh từng cặp, cung cấp một kiểm tra thực tế về các đánh giá tự động.

Dưới đây, chúng ta thấy kết quả BERTScore (F1) cho ba mô hình cơ bản: Qwen2.5-VL, InternVL3 và WeThink. Mỗi mô hình được kiểm tra trong ba cấu hình: No-Hint, Name-Only và hệ thống MovieTeller đầy đủ:

So sánh BERTScore (F1) trên ba mô hình cơ bản và ba thiết lập thử nghiệm, cho thấy sự cải thiện nhất quán khi thêm tên nhân vật và cải thiện hơn nữa khi bao gồm việc xác định không gian, với MovieTeller đạt được điểm số cao nhất trong tất cả các trường hợp.

So sánh BERTScore (F1) trên ba mô hình cơ bản và ba thiết lập thử nghiệm, cho thấy sự cải thiện nhất quán khi thêm tên nhân vật và cải thiện hơn nữa khi bao gồm việc xác định không gian, với MovieTeller đạt được điểm số cao nhất trong tất cả các trường hợp.

Các tác giả lưu ý rằng mẫu này nhất quán trên tất cả ba mô hình cơ bản: sử dụng chỉ khung hình thô cho kết quả yếu nhất; thêm tên nhân vật tạo ra sự cải thiện vừa phải; và kết hợp tên với hộp giới hạn cho kết quả mạnh nhất. Mặc dù những cải thiện này không quá ấn tượng, cấu hình được xác định đầy đủ đạt được sự tương đồng ngữ nghĩa cao nhất với tóm tắt tham chiếu, trong mọi thiết lập.

Về việc đánh giá chất lượng cốt truyện dựa trên LLM: như chúng ta thấy trong kết quả dưới đây, No-Hint cơ bản gặp khó khăn nhất với sự nhất quán của danh tính, điều này kéo điểm tổng thể của nó xuống. Nhưng cung cấp tên nhân vật đơn thuần tạo ra sự cải thiện đáng kể, đặc biệt là trên các chiều liên quan đến danh tính. Tuy nhiên, cấu hình MovieTeller đầy đủ lại đạt được điểm số cao nhất trên tất cả ba mô hình cơ bản:

Đánh giá LLM-as-a-Judge (1–5 thang) trên ba mô hình cơ bản, cho thấy việc thêm tên nhân vật cải thiện sự nhất quán của danh tính và chất lượng tổng thể, trong khi khuôn khổ MovieTeller đầy đủ đạt được điểm số cao nhất trên tất cả các chiều.

Đánh giá LLM-as-a-Judge (1–5 thang) trên ba mô hình cơ bản, cho thấy việc thêm tên nhân vật cải thiện sự nhất quán của danh tính và chất lượng tổng thể, trong khi khuôn khổ MovieTeller đầy đủ đạt được điểm số cao nhất trên tất cả các chiều.

Sự cải thiện mạnh nhất xuất hiện trong sự nhất quán của ID và điểm số trung bình cuối cùng, gợi ý rằng việc xác định không gian giúp mô hình giữ rõ ai đang làm gì khi cốt truyện tiến triển.

Trong đánh giá của con người về 50 tóm tắt được lấy mẫu ngẫu nhiên, các tham gia được hiển thị ba tóm tắt cùng một lúc và được yêu cầu chọn tóm tắt tốt nhất:

Tỷ lệ lựa chọn của con người trong một đánh giá so sánh ba cách, cho thấy tóm tắt của MovieTeller được chọn thường xuyên nhất trên tất cả ba mô hình cơ bản, vượt trội so với cả hai biến thể No-Hint và Name-Only.

Tỷ lệ lựa chọn của con người trong một đánh giá so sánh ba cách, cho thấy tóm tắt của MovieTeller được chọn thường xuyên nhất trên tất cả ba mô hình cơ bản, vượt trội so với cả hai biến thể No-Hint và Name-Only.

Cuối cùng, một thử nghiệm định tính đã được thực hiện trên bộ phim The Bullet Vanishes (2012):

Chúng tôi không thể sao chép toàn bộ hình này từ bài báo gốc, vì nó rất cao và dày đặc văn bản. Vui lòng tham khảo bài báo gốc thay thế.

Chúng tôi không thể sao chép toàn bộ hình này từ bài báo gốc, vì nó rất cao và dày đặc văn bản. Vui lòng tham khảo bài báo gốc thay thế.

Ở đây, No-Hint cơ bản tạo ra một tóm tắt mơ hồ đề cập đến các nhân vật bằng các thuật ngữ chung, và làm mờ vai trò của họ, khiến cho chuỗi sự kiện khó theo dõi. Cung cấp tên nhân vật đơn thuần cải thiện khả năng nhớ lại bề mặt, nhưng cốt truyện vẫn bị phân tán, với các mối quan hệ và động cơ của nhân vật được mô tả theo cách ‘phẳng’ hơn.

Ngược lại, phiên bản MovieTeller đầy đủ giữ danh tính ổn định trong suốt tóm tắt và gắn các hành động với nhân vật chính xác, cho phép cốt truyện điều tra tiến triển với cấu trúc nguyên nhân rõ ràng hơn. Các căng thẳng và động lực cụ thể được bảo tồn thay vì bị trừu tượng hóa, dẫn đến một tóm tắt đọc giống như một kể lại mạch lạc của弓 cốt truyện chính:

Phần của so sánh cuối cùng, mà chúng tôi không thể sao chép đầy đủ ở đây, hiển thị một tóm tắt bị cắt giảm và một tóm tắt MovieTeller đầy đủ. Vui lòng tham khảo bài báo gốc thay thế.

Phần của so sánh cuối cùng, mà chúng tôi không thể sao chép đầy đủ ở đây, hiển thị một tóm tắt bị cắt giảm và một tóm tắt MovieTeller đầy đủ. Vui lòng tham khảo bài báo gốc thay thế.

Kết luận

Mặc dù hầu hết các dự án mới thuộc loại này đều kết thúc trong văn học về Thị giác Máy tính, nhưng việc tóm tắt phim bằng trí tuệ nhân tạo bao gồm nhiều lĩnh vực và lĩnh vực nghiên cứu khác nhau trong học máy – và rất khó để biết lĩnh vực nào sẽ vô tình đóng góp mảnh ghép còn thiếu của câu đố; mặc dù MovieTeller đã tiến một bước đúng hướng bằng cách chia nhỏ các nhiệm vụ thành các mô

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai