Nền tảng AI

Phương tiện Tổng hợp: Các loại, Ứng dụng, Rủi ro và Nguồn gốc

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Phương tiện tổng hợp là nội dung kỹ thuật số được tạo ra hoặc thay đổi đáng kể bằng các hệ thống tự động. Nó bao gồm văn bản, hình ảnh, âm thanh, video, avatar và các kết hợp đa phương tiện. Một số nội dung được tạo hoàn toàn; các phương tiện khác thay đổi một bản ghi thực, khuôn mặt, giọng nói, đối tượng hoặc nền.

“Tổng hợp” không đồng nghĩa với việc lừa dối. Các kỹ thuật tương tự hỗ trợ sản xuất phim, khả năng tiếp cận, bản địa hoá, giáo dục và thiết kế, đồng thời cũng cho phép mạo danh, hình ảnh không có sự đồng ý, gian lận và thông tin sai lệch. Ý định, sự đồng ý, ngữ cảnh và việc tiết lộ quyết định phần lớn rủi ro.

Những điểm chính

  • Phương tiện tổng hợp bao gồm việc tạo ra và chỉnh sửa trên văn bản, hình ảnh, âm thanh, video và avatar tương tác.
  • Phát hiện mang tính xác suất và có thể giảm hiệu quả sau khi nén, chỉnh sửa hoặc thay đổi mô hình.
  • Dấu watermark, nhãn và nguồn gốc là các tín hiệu bổ trợ; không có tín hiệu nào chứng minh một khẳng định là đúng.
  • Sự đồng ý, danh tính, ngữ cảnh phân phối và phản hồi nhanh chóng phải có trong quy trình sản xuất.
Synthetic Media: Types, Applications, Risks, and Provenance diagram showing source, generate / edit, media, provenance, review, publish
Niềm tin đến từ bằng chứng lớp, sự đồng ý, tiết lộ và phản hồi — không chỉ dựa vào điểm số của bộ phát hiện.

Cách tạo phương tiện tổng hợp

Mô hình tự hồi quy tạo ra chuỗi token; mô hình khuếch tán làm giảm nhiễu cho hình ảnh, âm thanh hoặc video; GANs học một bộ tạo đối kháng; các hệ thống giọng nói tổng hợp lời nói từ văn bản hoặc chuyển đổi một giọng thành giọng khác.

Việc điều kiện có thể bao gồm lời nhắc, hình ảnh tham chiếu, chuyển động, mẫu giọng nói hoặc các điều khiển có cấu trúc. Công cụ chỉnh sửa có thể vẽ lại một vùng, thay đổi thời gian hoặc đồng bộ môi. Do đó, ranh giới giữa phương tiện được ghi lại và được tạo ra là một dải liên tục.

Ứng dụng hợp pháp

Nhà sáng tạo sử dụng các yếu tố tổng hợp cho bảng vẽ kịch bản, hiệu ứng hình ảnh và tạo mẫu nhanh. Các ứng dụng khả năng tiếp cận bao gồm tạo giọng nói, phụ đề và trợ giúp giao tiếp cá nhân hoá. Bản địa hoá có thể dịch và lồng tiếng lại nội dung giáo dục hoặc giải trí với sự cho phép.

Mô phỏng đào tạo có thể tạo ra các kịch bản hiếm, và bộ dữ liệu tổng hợp bảo vệ quyền riêng tư có thể giảm việc tiếp xúc với hồ sơ thực. Những việc dùng này vẫn cần kiểm tra chất lượng vì dữ liệu tổng hợp có thể tái tạo thiên lệch hoặc bỏ qua các trường hợp biên quan trọng.

Tác hại và mô hình đe dọa

Rủi ro bao gồm lừa đảo mạo danh, bằng chứng giả mạo, hình ảnh thân mật không có sự đồng ý, quấy rối, nội dung chính trị bị thao túng, tranh chấp bản quyền và sự suy giảm niềm tin vào phương tiện xác thực. Văn bản và giọng nói có thể có tác động tương đương với các video giả mạo (deepfake) đầy ấn tượng về mặt hình ảnh.

Mô hình đe dọa đặt câu hỏi danh tính nào được đại diện, ai đã đồng ý, nội dung sẽ được phân phối như thế nào, khẳng định nào nó dường như hỗ trợ và mức độ lan truyền hại nhanh như thế nào. Các biện pháp bảo vệ nên phù hợp với ngữ cảnh đó thay vì áp dụng một bộ lọc chung.

Phát hiện, dấu watermark và nguồn gốc

Bộ phát hiện ước lượng liệu nội dung có khớp với các dấu vết đã thấy trong quá trình huấn luyện; các mô hình mới, việc chỉnh sửa và nén có thể làm giảm độ chính xác. Dấu watermark nhúng hoặc gắn một tín hiệu, nhưng có thể bị loại bỏ hoặc không có. Nhãn chỉ hữu ích khi chúng vẫn được gắn và có thể hiểu được.

Chứng chỉ Nội dung C2PA liên kết mật mã các khẳng định về nguồn gốc của việc tạo và chỉnh sửa vào một tài sản. Chúng có thể làm cho việc giả mạo trở nên rõ ràng dưới một mô hình tin cậy, nhưng không đánh giá liệu sự kiện được mô tả hoặc khẳng định bằng văn bản có đúng hay không.

Quy trình xuất bản lớp

Thu thập sự đồng ý và ghi lại quyền nguồn trước khi tạo ra. Áp dụng các kiểm soát mô hình và lời nhắc, xem xét đầu ra nhạy cảm về danh tính, gắn nguồn gốc bền vững, tiết lộ các thay đổi quan trọng và duy trì một kênh leo thang cho khiếu nại hoặc mạo danh.

Các nền tảng và nhà xuất bản nên kết hợp nguồn gốc, phát hiện, tín hiệu tài khoản, kiểm tra thực tế và bằng chứng ngữ cảnh. Liên kết các kiểm soát này với an ninh mạng và quy trình sự cố AI sinh tạo, vì không có tín hiệu kỹ thuật nào đơn lẻ quyết định được.

Phương pháp và bằng chứng phương tiện tổng hợp

Phương tiện tổng hợp bao gồm hình ảnh, âm thanh, video, văn bản, avatar và môi trường ảo được tạo ra hoặc chỉnh sửa. Các phương pháp bao gồm GANs, khuếch tán, mô hình tự hồi quy, kết xuất thần kinh, tái hiện khuôn mặt, sao chép giọng nói, tổng hợp giọng nói, ghép ảnh và chỉnh sửa truyền thống. Ranh giới giữa tổng hợp và chỉnh sửa là liên tục. Một dấu vết thực tế không phải là bằng chứng cho một sự kiện đã xảy ra, và một dấu vết được phát hiện không phải là chứng minh ý định độc hại. Đánh giá nên bảo tồn tệp gốc, siêu dữ liệu, nguồn và chuỗi lưu trữ.

Việc tạo ra có thể hỗ trợ phim, khả năng tiếp cận, bản địa hoá, giáo dục, avatar bảo vệ quyền riêng tư, mô phỏng và tạo mẫu sáng tạo. Nó cũng có thể cho phép mạo danh, gian lận, quấy rối, hình ảnh thân mật không có sự đồng ý, tuyên truyền và bằng chứng giả mạo. Rủi ro phụ thuộc vào danh tính, sự đồng ý, khán giả, tiết lộ, ngữ cảnh, phân phối và hậu quả. Ủy quyền giọng nói hoặc hình ảnh nên chỉ rõ việc sử dụng cho phép và thời gian. Các nhân vật công chúng và người thường đều giữ các quyền và lợi ích an toàn quan trọng, ngay cả khi luật pháp khác nhau.

Nguồn gốc, dấu watermark và phát hiện

Nguồn gốc nội dung có thể ký mật mã các sự kiện ghi lại và chỉnh sửa và gắn các khẳng định thông qua tiêu chuẩn như C2PA. Nó giúp xác minh chuỗi khi các công cụ và nền tảng bảo tồn chứng chỉ, nhưng việc thiếu nguồn gốc không chứng minh tính sai và siêu dữ liệu có thể bị xóa. Dấu watermark có thể hiển thị hoặc ẩn và có thể báo hiệu nguồn gốc, nhưng nén, cắt, tái tạo và việc loại bỏ đối kháng làm giảm độ bền. Hãy sử dụng đồng thời nguồn gốc, tiết lộ, lịch sử tài khoản, xác nhận nguồn và phân tích pháp y.

Bộ phát hiện học các dấu vết hoặc mẫu thống kê nhưng giảm hiệu quả với các bộ tạo mới, xử lý hậu kỳ, ngôn ngữ và sự thay đổi phân phối. Các cảnh báo dương tính sai có thể gây hại cho con người và báo chí xác thực. Báo cáo độ không chắc đã được hiệu chỉnh và các điều kiện xác thực; không bao giờ đưa ra cáo buộc quan trọng chỉ dựa vào một điểm số của bộ phát hiện. Các nhà phân tích con người nên so sánh bằng chứng độc lập và ghi lại công cụ và phiên bản. Các nền tảng cần báo cáo nhanh, bảo tồn, kháng cáo và phản hồi cho lạm dụng dựa trên danh tính và thao túng trong bầu cử hoặc tình huống khẩn cấp.

Sản xuất và xác minh có trách nhiệm

Nhà sáng tạo nên thu thập sự đồng ý, bảo vệ dữ liệu tham chiếu, gắn nhãn các tài liệu có thể gây hiểu lầm và lưu giữ hồ sơ tạo ra. Các tổ chức nên đào tạo nhân viên xác minh các yêu cầu giọng nói hoặc video khẩn cấp qua kênh độc lập, đặc biệt đối với thanh toán hoặc chứng chỉ. Bảo mật các đường ống mô hình và phương tiện, giới hạn tần suất các tính năng mạo danh, và ngăn chặn giọng nói hoặc khuôn mặt tùy chỉnh không được phép. Phương tiện tổng hợp đang trở thành công cụ sản xuất thông thường; việc sử dụng đáng tin cậy phụ thuộc vào nguồn gốc và ngữ cảnh, trong khi khán giả và tổ chức kiên cường phải xác minh các khẳng định thay vì chỉ dựa vào tính thực tế hình ảnh.

Ví dụ thực tế: xác minh tin nhắn giọng nói tổng hợp khẩn cấp

Một nhân viên tài chính nhận được tin nhắn giọng nói trông giống như CEO yêu cầu chuyển tiền khẩn cấp. Chính sách cấm phê duyệt chỉ dựa trên giọng nói. Nhân viên liên hệ với giám đốc qua một kênh độc lập đã biết, xác minh giao dịch trong hệ thống thanh toán và báo cáo tin nhắn. Bộ phận bảo mật bảo tồn tệp gốc, tiêu đề, lịch sử tài khoản và thời gian thay vì chỉ dựa vào bộ phát hiện deepfake.

Cuộc điều tra kết hợp siêu dữ liệu nguồn gốc, phân tích âm học với mức độ không chắc đã nêu, kiểm tra xâm phạm danh tính và thông tin chiến dịch. Kết quả phát hiện không bao giờ được trình bày là quyết định cuối cùng cho nhân viên hoặc cơ quan thực thi pháp luật nếu không có xác thực bổ sung. Tổ chức chặn nguồn, cảnh báo các đội mục tiêu, đặt lại các chứng chỉ bị ảnh hưởng và xem xét các mẫu giọng nói công khai cùng quy trình nhà cung cấp. Đào tạo nhấn mạnh quy trình: tính khẩn cấp và thực tế không vượt qua yêu cầu phê duyệt kép. Khả năng chịu đựng của phương tiện tổng hợp đến từ các kênh đã xác minh và ranh giới quyền hạn cũng như các mô hình pháp y.

Bằng chứng triển khai và sẵn sàng vận hành

Quyết định sản xuất cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng dự kiến, môi trường vận hành, đầu vào, đầu ra, phụ thuộc, người chịu trách nhiệm và hậu quả của mỗi lỗi quan trọng. Thiết lập nền tảng có thể tái tạo và bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thông thường, điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự thay đổi phân phối, mất kết nối phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu thốn. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi chuyển đổi và ngưỡng để người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.

Trước khi ra mắt, chỉ định người có thẩm quyền cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng hoạt động. Sử dụng triển khai theo giai đoạn, bảo tồn một phương án dự phòng an toàn và xác minh giám sát bằng các lỗi được đưa vào cố ý. Dữ liệu đo lường hoạt động nên hiển thị chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, tình trạng phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì cho rằng hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có quy trình khôi phục, học hỏi từ sự cố, xóa và lưu trữ được ghi chép, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.

Câu hỏi thường gặp

Mọi bức ảnh đã chỉnh sửa đều là phương tiện tổng hợp?

Định nghĩa có thể khác nhau. Các chỉnh sửa thông thường nhẹ có thể không được mô tả là tổng hợp, trong khi các thay đổi tự động được tạo ra hoặc có ý nghĩa ngữ nghĩa thường được xem là tổng hợp. Việc tiết lộ nên tập trung vào những thay đổi ảnh hưởng đến cách hiểu.

Chứng chỉ nội dung có chứng minh phương tiện là trung thực không?

Không. Chúng có thể cung cấp các khẳng định nguồn gốc có khả năng phát hiện giả mạo. Một bản ghi hợp lệ vẫn có thể đi kèm với ngữ cảnh gây hiểu lầm hoặc một khẳng định sai.

Tài liệu tham khảo chính

Haziqa là một Nhà khoa học dữ liệu với kinh nghiệm rộng rãi trong việc viết nội dung kỹ thuật cho các công ty AI và SaaS.